使用R語言作文字資料處理

使用R語言作文字資料處理

文字探勘是一種利用電腦軟件從文本來源(如文檔,書信,書籍和雜誌)提取及分析文本的技術。在數碼學術的領域內,透過文字探勘去研究文本當中隱藏的模式及關係亦漸見流行。此技術旨在利用最少的人手參與,透過應用了語言學,統計學和機器學習方法的軟件去整理及理解結構化或非結構化的文本來源。由於市面上大部份文字探勘的軟件主要是分析西方語系資料,透過電腦處理中文及分析自然語言已經不容易,再去處理古代中國文字則更為困難。

香港中文大學圖書館擁有大量珍貴的中文館藏,並已將其數碼化。圖書館的數碼學術研究團隊希望在本項目嘗試運用文本探勘技術,為圖書館的中文數碼館藏提供新的研究視角。本項目旨在利用「R」語言處理和分析香港中文大學文物館所藏的盛宣懷檔案,展示如何對中文文本進行計算文本處理與分析。

本項目選用了 R 分詞套件(例如 jiebaR),並初步應用於其中兩冊以進行概念驗證。項目中詳細記錄了計算文本處理的完整流程,從建置 R 環境到建立詞頻矩陣(詞項-文檔矩陣,TDM)及文字雲。相關的R 指令及文件可點擊這裡下載。不過,這只是第一階段的工作,我們期望透過詳盡的文檔紀錄,能讓研究人員進一步處理其他盛宣懷文獻,並為下一階段的發展帶來文本聚類(text clustering)或主題建模(topic modelling)等文本分析的可能性。歡迎讀者參閱報告以獲取有關流程的更多資訊,並下載程式碼重覆使用。

項目負責人:戴昀博士(數碼學術研究團隊前博士後研究員)
查詢:dslab@lib.cuhk.edu.hk