首页

常用中药丹方100 中医丹方数据库文本发掘数据预处理的测验

点击:0时间:2020-11-18 14:33:20

吴磊+李舒

摘要:意图针对中医丹方数据发掘需求提出一套以数据清洗为主的数据预处理办法,使数据标准、精确和有序,利于后续处理。办法经过检索技能,在丹方数据库中获取文本数据源,将非标准化的数据经过辅佐词群行处理、正则表达式替换、异名处理等进程进行清洗,改善数据质量。成果在我国丹方数据库共检索到1758条记载,在丹方现代运用数据库共检索到91条记载。源文本数据经预处理后共得到有用记载6913味药,可成功导入相关信息发掘体系进行丹方称号和中药名词的信息抽取。结论本办法适用于根据中医丹方数据库的文本发掘和常识发现,可成功对源文本数据施行清洗,得到标准一致、无噪声的数据,完成所需方药信息的有用抽取,可为中医丹方文本型数据信息剖析与发掘研讨供给有利的学习。

关键词:中医丹方:丹方数据库:文本发掘:数据预处理:数据清洗

doi:10.3969/j.issn.2095-5707.2015.03.003An Attempt on Data Preprocessing for Text Mining in TCM Prescription DatabaseWU Leil, LI Shu2(1. Information Engineering College, Liaoning University of TCM, Shenyang Liaoning 110847, China;2. Department of Medical Informatics, China Medical University, Shenyang Liaoning 110001, China)

Abstract: Objective To propose a set of data preprocessing method based on data cleaning for TCMprescription database; To make data more standard, accurate and orderly, and convenient for follow-up processing.Methods The text data source was retrieved from prescription databases by bibliographic searching techniques.Non-nonnalized data were processed through steps followed by auxiliary word group line processing, regularexpression substitution, and synonyms processing, with a purpose to unprove data quality. Results Totally 1758effective records were retrieved from TCM prescription database, and 91 records were retrieved from prescriptionmodern application database. 6913 effective Chinese herbal medicines were retrieved after preprocessing, whichcan be successfully imported into relevant information mining system, and information about prescription andherb names can be extracted. Conclusion This method is applicable for text mining and knowledge discovery in TCM prescription database. It can successfully implement data cleaning for source text data, get data with unifiedstandard and without noise, and finally realize the effective extraction of prescription information, which canprovide references for researches on analysis and mining ofTCM prescription text data.

Key words: TCM prescriptions; prescription database; text mining; data preprocessing; data cleaning

近年来中医药信息化发展迅速,已构建及完善了许多的中医丹方数据库,中医丹方数据发掘和文本发掘方兴未已。尽管丹方数据库是经过必定校正订正后的结构化数据库,但库华夏始数据通常因年代跨度大,并保留了不同时期原方的信息特色,对丹方、药物信息的表述精确性及标准一致方面存在一些问题,存在过错的、冗余的、无效的和不一致的噪声数据。因而直接抽取原生信息无法满意数据发掘和常识发现的具体要求,需求对数据进行必要的预处理,使之标准、精确和有序,完成数据的正确表达和合理安排,到达数据发掘的基本条件。

数据预处理是数据发掘中极为重要的方面。数据发掘进程的大部分作业都在数据预处理环节。根据计算,在一个完好的数据发掘进程中,数据预处理占用约60%的时刻,然后的发掘作业仅占总作业量的10%左右。数据清洗( data cleaning)是解决问题数据的首要预处理进程,对保证数据质量具有重要效果。本文以中医医治中风病丹方数据发掘为例,讨论一种以数据清洗为主的数据预处理办法,为后续配伍规则常识发现研讨供给数据支撑。

材料与办法

数据来历

因为本研讨首要针对丹方称号和药物称号进行预处理,因而选用了两个具有丹方和药物称号的数据库,即我国丹方数据库和丹方现代运用数据库,均隶归于我国中医科学院中医药信息研讨所自1984年开端进行建造的中医药学大型数据库群。

在中医药在线(http://www.cintcm.com/)的中医药多库交融渠道( http://cowork.cint cm.com/engine/windex.jsp)中,挑选丹方类数据库中的我国丹方数据库和丹方现代运用数据库,字段挑选均用“主治”,含糊检索,输入“中风”,年代不限,检索时刻为2013年11月27日。

研讨办法与东西

根据辅佐词群的行处理东西 文本行抽取和处理是文本数据预处理中的常用办法,而根据辅佐词群的办法可有用进步其灵敏度。该办法是根据预先树立的包含辅佐词群的辅佐文件,可对源文件完成抽取或去除包含辅佐文件中词群的行输出;并可按给定的批量行号提取行。

本研讨中的行处理由数字人文研讨内容发掘体系ROST CM完成。

正则表达式文本处理东西正则表达式是一种能够用于方式匹配和替换的标准,一个正则表达式就是由一般的字符以及特别字符组成的文字方式,它用以描绘在查找文字主体时待匹配的一个或多个字符串。在许多文本编辑器或其他东西里,正则表达式通常被用来检索和/或替换那些契合某个方式的文本内容。

正则表达式可用来验证字符串是否契合指定特征并用来查找字符串,比查找固定字符串愈加灵敏便利;能够用来替换,比一般的替换更强壮。例如表达式“ab+”描绘的特征是一个“a”和恣意个“b”,那么“ab”“abb”“abbbbbbbbbb”都契合这个特征。

本研讨中的正则表达式处理由文本处理东西Textpro完成。

归入和扫除标准

归入标准:以丹方主看病证中清晰呈现中风、半身不遂、偏枯、瘫痪、神识昏蒙、言语蹇涩或不语、口眼歪斜及其近义词或近义词为主症,筛选出主治这些主症的丹方或其主治内容所包含的信息与已知的中风病病因病机契合的丹方。

扫除标准:扫除丹方所治症状可清晰为其他要素(非中风)所引起的偏枯、偏瘫、口眼歪斜等,无主症或主症不契合,及归于医治外感表证和类中风(中寒、中暑、中湿、痰厥等致半身不遂、偏枯瘫痪)的中风丹方,如风痹;外风、风湿/类风湿型产后中风、小儿中风;风寒/伤寒中风,破伤中风,心肺中风,脾胃中风,肝脏中风,中毒等。2成果与剖析

我国丹方数据库共检索到1758条记载,在丹方现代运用数据库共检索到91条记载。以“一般模板”进行套录,保存为HTML格局;再将源文件的HTML格局转为ANSI编码的TXT格局;最终来自两个数据库的两组文本兼并。之后经标准过滤并整理去重后,共得到有用记载648条,从头编号后构成待处理源文本,其间取自我国丹方数据库1号源文件的部分文本数据如图1所示。

根据辅佐词群的文本行处理

为提取源数据中首要重视的方药信息,运用ROSTCM的根据辅佐词群的行抽取与处理办法对信息进行整理,“方名”和“药物组成”两字段在外。辅佐词群设置为[别号][处方来历][剂型][成效][加减][主治][制备办法][用法用量][用药忌讳][用法用量][各家论说][临床运用][补白][药理效果]。经过文本行处理后,源文件内容转为如下方式,如图2所示。

根据正则表达式的文本处理

本研讨中,因特别制法和剂量信息暂不考虑,这些信息需求被屏蔽。文根源数据的特别制法部分都采用了中文括号标明,故运用正则表达式替换操作,表达式设置为“\([^)]冰\)”(意为从一个开括号到最近的闭括号)。该操作在支撑REGEX的Textpro东西中进行,如图3所示。

如“何首乌1斤(赤、白色者参半,米泔浸3宿取出,用竹刀刮去皮,薄切,焙干)”,处理完形后,为“何首乌1斤(p)”。

关于剂量信息,首要删去药名后的“等”和“各等分”字符,如“川芎等”、“当归各等分”,去掉后为“川芎”“当归”;再运用自定义替换功用将中文剂量字符一致转化为数字字符,如将“半两”转为“0.5两”;最终再铲除剂量和制法信息。具体做法为:运用正则表达式“\d[^:]冰\:”(意为从一个数字字符到最近的英文分号),将其替换为英文分号,可将剂量信息去除。

药物称号不一致处理

源文本中的“药物组成”字段为长文本类型,包含各种中草药的称号,对错标准化的数据,存在不一致问题。中药品种很多,称号杂乱,因年代、地域不同而有别,常根据药物的形状、产地、色彩、成效等特征来命名。因而源文本数据中同药异名、同名异药的现象非常遍及。例如僵蚕处方名有天虫、僵虫、白僵虫等多种称号,但均实属同一药物,应都标准为僵蚕。

本研讨的中药异名问题,首要参阅《中药学》教材及《中药大辞典》进行标准化处理。准则大将长名转为短名,如:明天麻转为天麻,甘菊花转为菊花等,如反之,则会呈现如“甘甘菊花”的无效成果;但有些药确要将短名化长名,则需承认源文本中药名前后皆以英文分号结束(无剂量等信息):如将“芎”化为“川芎”,“白附”化为“白附子”。

根据参阅书树立药名转化标准对照表,运用Textpro的自定义替换功用载入该表,对源文本数据批量处理,标准化药名,如表1所示。

关于“芎?”这类特别字符构成方式,在部分体系处理完毕后呈现未能匹配成功替换状况,可运用独自替换功用从头处理一遍。 此外,源数据中某些药物与现代中药存在不同,有一些药名≥2个中药兼并起来的简称,为了一致药名,需求将其拆分开来,如将苍白术拆分为苍术、白术。

源文本数据经预处理后共得到有用记载6913味药,部分成果如图4所示。

本研讨标明,该预处理办法可成功地对源文本数据施行清洗,得到标准一致、无噪声的数据,因而是有用的。成果数据可导入书目信息共现发掘体系(BICOMB)进行丹方称号和中药名词的信息抽取,为进一步进行常识发现供给了有力的数据支撑。

小结

数据清洗就是经过各种办法,从精确性、一致性、无冗余、契合运用的需求等方面进步数据的质量,本质是消除数据中的过错和不一致。现在,中医药信息处理与剖析中的数据预处理办法品种繁复,本文试用一种定制的以数据清洗为主的数据预处理办法对非标准的原始数据进行了有用的处理,是中医药数据发掘和文本范畴的一次有利测验,期望对后续研讨起到抛砖引玉的效果,并推行至其他中医丹方类文本型数据库数据发掘的数据预处理中,为中医丹方数据发掘和文本发掘研讨供给新办法和技能手段。

相关资讯
最新新闻
关闭