《電子技術應用》
您所在的位置:首頁 > 其他 > 設計應用 > 基于詞匯增強和表格填充的中文命名實體識別
基于詞匯增強和表格填充的中文命名實體識別
電子技術應用
褚天舒1,唐球1,梁軍學2,徐睿1,王明陽2,劉濤2
1.華北計算機系統工程研究所,北京 100083;2.中國人民解放軍93216部隊,北京 100085
摘要: 中文命名實體識別主要包括中文平面命名實體識別和中文嵌套命名實體識別兩個任務,其中中文嵌套命名實體識別任務難度更大。提出了一個基于詞匯增強和表格填充的統一模型TLEXNER,該模型能夠同時處理上述任務。該模型首先針對中文語料分詞困難的問題,使用詞典適配器將詞匯信息融合到BERT預訓練模型,并且將字符與詞匯組的相對位置信息集成到BERT的嵌入層中;然后通過條件層歸一化和雙仿射模型構造并預測字符對表格,使用表格建模字符與字符之間的關系,得到平面實體與嵌套實體的統一表示;最后根據字符對表格上三角區域的數值判斷實體類別。提出的模型在平面實體的公開數據集Resume和自行標注的軍事領域嵌套實體數據集上F1分別是97.35%和91.96%,證明了TLEXNER模型的有效性。
中圖分類號:TP391 文獻標志碼:A DOI: 10.16157/j.issn.0258-7998.233939
中文引用格式: 褚天舒,唐球,梁軍學,等. 基于詞匯增強和表格填充的中文命名實體識別[J]. 電子技術應用,2024,50(2):23-29.
英文引用格式: Chu Tianshu,Tang Qiu,Liang Junxue,et al. Chinese named entity recognition based on lexicon enhancement and table filling[J]. Application of Electronic Technique,2024,50(2):23-29.
Chinese named entity recognition based on lexicon enhancement and table filling
Chu Tianshu1,Tang Qiu1,Liang Junxue2,Xu Rui1,Wang Mingyang2,Liu Tao2
1.National Computer System Engineering Research Institute of China, Beijing 100083, China; 2.People′s Liberation Army 93216, Beijing 100085, China
Abstract: Chinese named entity recognition has been involved with two tasks, including Chinese flat named entity recognition and Chinese nested named entity recognition. Chinese nested named entity recognition is more difficult. Therefore, this paper proposes a unified model, namely TLEXNER, based on lexicon enhancement and table filling, which can tackle the above two tasks concurrently. Aiming at the difficulty of Chinese word segmentation, the lexicon adapter is used to integrate the lexicon information into the BERT pre-training model,and integrates the relative position information of characters and lexical groups into the BERT embedding layer. Then conditional layer normalization and biaffine model is used to build and predict the representation of the character-pair table, and the relationship between character pairs is modeled by table structure to obtain the unified representation of flat entities and nested entities.
Key words : lexicon enhancement;Chinese named entity recognition;table filling

引言

在大數據時代,每天都產生海量的文本數據,如何從這些存在大量冗余的數據中獲取真正有價值的知識信息顯得愈發重要。使用知識抽取方法能夠自動識別并提取所需知識要素信息,為后續的知識融合、知識加工、知識應用提供數據支撐,其中命名實體識別是知識抽取的重要任務,也是知識圖譜、數據挖掘、智能檢索、問答系統等下游任務的基礎,命名實體識別技術的研究具有重要的理論需求與現實意義。

中文命名實體識別根據粒度劃分可分為基于詞的命名實體識別、基于字符的命名實體識別和基于字詞混合的命名實體識別。與英文命名實體識別相比,中文沒有明確的單詞分隔符號,因此,中文命名實體識別存在分詞困難的問題。


本文詳細內容請下載:

http://www.jysgc.com/resource/share/2000005850


作者信息:

褚天舒1,唐球1,梁軍學2,徐睿1,王明陽2,劉濤2

1.華北計算機系統工程研究所,北京 100083;2.中國人民解放軍93216部隊,北京 100085


weidian.jpg

此內容為AET網站原創,未經授權禁止轉載。
主站蜘蛛池模板: 又大又硬又爽又粗又快的视频免费| 女神校花乳环调教| 嫩b人妻精品一区二区三区| 国产精品资源站| 国产一级黄色大片| 亚洲欧美日韩在线线精品| 久久亚洲色一区二区三区| a级毛片高清免费视频在线播放| 800av在线播放| 精品露脸国产偷人在视频7| 欧美激情观看一区二区久久| 日本亚洲高清乱码中文在线观看| 大伊香蕉精品一区视频在线 | a级黄色毛片视频| 黄瓜视频网站在线观看| 男人添女人30分钟免费| 日韩美一区二区| 天天射天天干天天舔| 国产又粗又猛又大的视频 | 真精华布衣3d1234正版图2020/015| 最后一夜无删减版在线观看| 女人与公拘交酡过程高清视频| 国产成人免费av片在线观看| 人人妻人人狠人人爽| 久久久噜噜噜www成人网| 一区二区三区在线|欧| 51久久夜色精品国产| 精品国产污污免费网站入口| 欧美xxxxx做受vr| 天天操天天干天天操| 国产中文欧美日韩在线| 亚洲午夜无码久久久久小说| 一级一级特黄女人精品毛片 | 精品欧洲videos| 日韩欧国产精品一区综合无码| 国模无码一区二区三区不卡| 和黑帮老大365天完整版免费| 亚洲一区中文字幕在线观看| AV中文无码乱人伦在线观看| 色妞色视频一区二区三区四区| 欧美va天堂在线电影|