ByteBard 專有名詞辨識

Facebook Twitter LinkedIn LINE Skype EverNote GMail Yahoo Email

前言

本文將探討常見的專有名詞辨識方法,並說明其在自然語言處理中的應用與挑戰。

目的

專有名詞辨識是名詞辨識的一部分,其核心目標在於支援詞性標註(Part of Speech tagging)。

一般名詞在語言中相對穩定,往往數十年間仍持續使用。然而,專有名詞的生命週期卻不如普通名詞長久:

  • 新生:不斷有新的公司、產品或社會現象出現。
  • 衰退:部分專有名詞因公司倒閉或產品停產而逐漸乏人問津。
  • 消失:少數情況下,政權更替或文化轉變會使某些專有名詞徹底消失。

由於專有名詞持續演進,並不存在一次到位的解決方案。實務上常見的做法是定期更新詞庫,彷彿為人類文化做一個「快照」(snapshot),以維持辨識系統的有效性。

演算法

常見的專有名詞辨識方法主要有以下三種:

  • 詞典法:將已知的專有名詞收錄於字典檔中,直接比對。
    • 優點:簡單、快速。
    • 缺點:缺乏彈性,無法外推,遇到新名詞時無法處理。
  • 特徵法:利用專有名詞的表面特徵,例如英文專有名詞通常含有至少一個大寫字母。
    • 優點:方便、易於自動化。
    • 缺點:容易引入錯誤,無法完全依賴。常用於自動標註銀資料(silver data),再由人工修正。
  • 規則法:透過上下文規則進行辨識,例如「清華大學」可視為 專有名詞 + 名詞 的結構。
    • 優點:可由手寫規則或模型學習隱藏規則,具一定外推能力。
    • 缺點:並非百分之百可靠。

在實務應用中,並不會只依賴單一方法,而是根據不同階段與需求,靈活結合多種方法來進行標註。

在台語語料中標註英文專有名詞

在此情境中,我們採用了特徵法,原因如下:

  • 台語語料中的英文通常僅以單字形式出現。
  • 英文具備穩定且可利用的特徵。

少數情況下會出現錯誤,例如語料中包含整句英文。但這類情境發生機率偏低,因此可視為雜音(noise)。

此方法的優勢在於不需維護專有名詞字典,等於以「時間換取空間」的演算法。

標註漢語專有名詞

在華語、台語、客語等漢族語言中,由於文字是方塊字,缺乏可直接利用的表面特徵,因此主要依靠字典法規則法

  • 常見且相對穩定的專有名詞,建議使用字典法,簡單且可靠。
  • 冷僻或變動性較高的專有名詞,則可透過模型學習隱藏規則來處理。雖然結果不會百分之百正確,但相較於僅依賴字典法,更能提升辨識的廣度與彈性。

這樣的策略反映了漢族語言的特性:由於方塊字無法提供形態特徵,只能透過字典與規則來維持辨識的準確性。

結論

專有名詞辨識在自然語言處理中扮演關鍵角色。由於專有名詞的動態性與文化依存性,沒有單一方法能完全解決所有問題。詞典法、特徵法與規則法各有優缺點,實務上往往需要靈活組合,並隨著語料更新而調整。透過這樣的策略,我們才能在持續演變的語言環境中,維持辨識系統的準確性與實用性。