PyQt5 批量刪除 Excel 重復數據,多個文件、自定義重復項一鍵刪除...


需求說明:將單個或者多個Excel文件數據進行去重操作,去重的列可以通過自定義制定。

【閱讀全文】

開始源碼說明之前,先說明一下工具的使用過程。

1、准備需要去重的數據文件。

file

file

2、使用工具執行去重操作。

file

3、處理完成后的結果文件。

file

file

PyQt5 界面UI相關的模塊引用

from PyQt5.QtWidgets import *
from PyQt5.QtGui import *

核心組件

from PyQt5.QtCore import *

主題樣式模塊引用

from QCandyUi import CandyWindow

在這個應用中使用一個默認的楊氏模塊QCandyUi,可以改變整個應用的主題顏色設計不用一個控件一個控件的去修改樣式。有一個不好的地方就是應用本身設置的標題和應用圖標不能生效,必須利用這個樣式控件CandyWindow來修改,就像下面這樣需要將我們自己寫的UI空間放到里面。

# w = CandyWindow.createWindow(EDataDel(), theme='blueGreen', title='Excel批數據去重器  公眾號:[Python 集中營]',
#                                  ico_path='數據去重.ico')
#     w.show()

應用操作相關模塊

import sys
import os

Excel數據處理模塊

import pandas as pd
import openpyxl as pxl

UI界面布局設計、信號量槽函數綁定實現

class EDataDel(QWidget):
    def __init__(self):
        super(EDataDel, self).__init__()
        self.init_ui()

    def init_ui(self):
        self.brower = QTextBrowser()
        self.brower.setReadOnly(True)
        self.brower.setFont(QFont('微軟雅黑', 8))
        self.brower.setPlaceholderText('處理進程展示區域...')
        self.brower.ensureCursorVisible()

        form = QFormLayout()
        self.file_paths = QLineEdit()
        self.file_paths.setReadOnly(True)

        self.file_paths_btn = QPushButton()
        self.file_paths_btn.setText('加載批文件')
        self.file_paths_btn.clicked.connect(self.file_paths_btn_click)

        self.colums_label = QLabel()
        self.colums_label.setText('自定義去重復列')

        self.colums_text = QLineEdit()
        self.colums_text.setPlaceholderText('列名1,列名2,列名3,...')


        form.addRow(self.file_paths, self.file_paths_btn)
        form.addRow(self.colums_label, self.colums_text)

        self.work = DataWork(self)
        self.work.trigger.connect(self.update_log)
        self.work.finished.connect(self.finished)

        vbox = QVBoxLayout()
        self.start_btn = QPushButton()
        self.start_btn.setText('開始執行')
        self.start_btn.clicked.connect(self.start_btn_click)

        vbox.addLayout(form)
        vbox.addWidget(self.start_btn)

        hbox = QHBoxLayout()
        hbox.addWidget(self.brower)
        hbox.addLayout(vbox)

        self.setLayout(hbox)

    def file_paths_btn_click(self):
        paths = QFileDialog.getOpenFileNames(self, '選擇文件', os.getcwd(), 'Excel Files(*.xlsx)')
        files = paths[0]
        path_strs = ''
        for file in files:
            path_strs = path_strs + file + ';'
        self.file_paths.setText(path_strs)
        if self.file_paths.text().strip() != '':
            self.update_log('已經完成批文件路徑加載!')
        else:
            self.update_log('沒有選擇任何文件!')

    def save_dir_btn_click(self):
        directory = QFileDialog.getExistingDirectory(self, '選擇文件夾', os.getcwd())
        self.save_dir.setText(directory)

    def update_log(self, text):
        cursor = self.brower.textCursor()
        cursor.movePosition(QTextCursor.End)
        self.brower.append(text)
        self.brower.setTextCursor(cursor)
        self.brower.ensureCursorVisible()

    def start_btn_click(self):
        self.start_btn.setEnabled(False)
        self.work.start()

    def finished(self, finished):
        if finished is True:
            self.start_btn.setEnabled(True)

創建子線程,處理業務邏輯(清理Excel重復文件)

class DataWork(QThread):
    trigger = pyqtSignal(str)
    finished = pyqtSignal(bool)

    def __init__(self, parent=None):
        super(DataWork, self).__init__(parent)
        self.parent = parent
        self.working = True

    def __del__(self):
        self.working = False
        self.wait()

    def run(self):
        self.trigger.emit('啟動批量處理子線程...')
        file_paths = self.parent.file_paths.text().strip()
        colums_text = self.parent.colums_text.text().strip()
        colums = []
        if ',' in colums_text:
            colums = colums_text.split(',')
        else:
            colums.append(colums_text)
        self.trigger.emit('獲取配置項完成!')
        for file in file_paths.split(';'):
            if file.strip() != '':
                web_sheet = pxl.load_workbook(file)
                sheets = web_sheet.sheetnames
                print(file)
                new_file = file.split('.')[0] + '_已去重.' + file.split('.')[1]
                print(new_file)
                writer = pd.ExcelWriter(new_file)
                for sheet in sheets:
                    sheet_name = sheet.title()
                    print(sheet_name)
                    self.trigger.emit('准備處理工作表名稱:' + str(sheet.title()))
                    data_frame = pd.read_excel(file, sheet_name=sheet_name)
                    print(data_frame)
                    repe = data_frame.duplicated(subset=colums)
                    repe = repe[repe]
                    print(data_frame.iloc[repe.index])
                    res = data_frame.drop_duplicates(subset=colums)
                    print(res)

                    self.trigger.emit(str(sheet.title()) + ':已清除')
                    res.to_excel(writer, sheet_name, index=False)
                writer.save()
            else:
                self.trigger.emit('當前文件路徑為空,繼續...')
        self.trigger.emit('數據處理完成...')
        self.finished.emit(True)

使用主函數啟動整個應用

if __name__ == '__main__':
    app = QApplication(sys.argv)
    w = CandyWindow.createWindow(EDataDel(), theme='blueGreen', title='Excel批數據去重器  公眾號:[Python 集中營]',
                                 ico_path='數據去重.ico')
    w.show()
    sys.exit(app.exec_())

file

【往期精彩】

再見XShell,這款國人開源的終端命令行工具更nice!

python 表情包下載器,輕松下載上萬個表情包、斗圖不用愁...

Python 自動清理電腦垃圾文件,一鍵啟動即可...

有了jmespath,處理python中的json數據就變成了一種享受...

解鎖一個新技能,如何在Python代碼中使用表情包...

萬能的list列表,python中的堆棧、隊列實現全靠它!

該怎么用pyqt5來實現數據的增、刪、改、查功能...

python批量自動整理文件

介紹一個文本語音神器,幾行代碼就能搞定!

初學者福利:分享五個免費的 Python 學習網站,抓緊收藏吧!

有趣的控制台玩法:一行代碼繪制控制台圖像!

數據處理小工具:Excel 批量數據文件拆分/整合器...


免責聲明!

本站轉載的文章為個人學習借鑒使用,本站對版權不負任何法律責任。如果侵犯了您的隱私權益,請聯系本站郵箱yoyou2525@163.com刪除。



 
粵ICP備18138465號   © 2018-2025 CODEPRJ.COM