使用R语言作文字资料处理
文字探勘是一种利用电脑软件从文本来源(如文档,书信,书籍和杂志)提取及分析文本的技术。在数码学术的领域内,透过文字探勘去研究文本当中隐藏的模式及关系亦渐见流行。此技术旨在利用最少的人手参与,透过应用了语言学,统计学和机器学习方法的软件去整理及理解结构化或非结构化的文本来源。由于市面上大部份文字探勘的软件主要是分析西方语系资料,透过电脑处理中文及分析自然语言已经不容易,再去处理古代中国文字则更为困难。
香港中文大学图书馆收藏了大量珍贵的中文资料,并已将其数码化。图书馆的数码学术研究团队希望藉由本项目尝试运用文本探勘技术,为图书馆的中文数位馆藏提供新的研究视角。本项目旨在利用「R」语言处理和分析香港中文大学文物馆所藏的盛宣怀档案,展示如何对中文文本进行计算文本处理与分析。
本项目选用了 R 分词套件(例如 jiebaR),并初步应用于其中两册以进行概念验证。项目中详细记录了计算文本处理的完整流程,从建置 R 环境到建立词频矩阵(词项-文档矩阵,TDM)及文字云。相关的R 指令及文件可点击这里下载。不过,这只是第一阶段的工作,我们期望透过详尽的文档纪录,能让研究人员进一步处理其他盛宣怀文献,并为下一阶段的发展带来文本聚类(text clustering)或主题建模(topic modelling)等文本分析的可能性。欢迎读者参阅报告以获取有关流程的更多资讯,并下载程式码重复使用。
项目负责人:戴昀博士(数码学术研究团队前博士后研究员)
查询:dslab@lib.cuhk.edu.hk