AI 寫的繁體中文為什麼會混進簡體字
發布於 2026-08-04 · 約 5 分鐘 ·作者:華智匯編輯部
有一批字同時是簡體字形與獨立的繁體正字(云、丑、干、台、后、里),所以「轉成繁體會不會變」這個判準會把這些正字誤判為簡體。
大模型產出繁體的機制
目前主流大模型在處理中文時,底層的訓練資料以簡體中文佔大宗。這代表模型在「學會」中文的過程中,主要接觸的是簡體字形與簡體語料。當使用者要求繁體中文輸出時,模型做的事情不是「用繁體思考」,而是在生成之後進行一次字形映射——把簡體字形轉換成對應的繁體字形。
這個過程本身就不穩定。映射依賴的是模型內化的一套對照表,而非一套有明確規則的轉換引擎。當模型對某個字的映射信心不足,或上下文沒有提供足夠線索時,它可能直接保留簡體字形,不做轉換。
單字滲入:最常見的失敗模式
大模型混入簡體的方式,通常不是整段變成簡體,而是單字滲入。一段正確的繁體散文裡,偶爾會出現一兩個簡體字形,像是 这(對應「這」)、个(對應「個」)、说(對應「說」)。這種錯誤很難用肉眼掃過就發現,因為讀者的眼睛會自動補全。
真正的簡體混入很少只有一個字。一旦模型在某處滑進簡體模式,这、个、时、说、国 這些沒有繁體身分的字形會接連出現。它們是純粹的簡體字,在任何繁體辭典裡都找不到。
身分模糊的字:轉換器的陷阱
更棘手的問題不在於那些「一看就是簡體」的字,而在於那些身分模糊的字。有些字形同時是簡體字,也是獨立的繁體正字。這些字不能用「轉成繁體之後會不會變」來判斷,因為它們不需要變——它們本來就是正確的。
常見的例子包括:
云:簡體是云,繁體「雲」的簡化。但「人云亦云」裡的云是正字,不是簡體。丑:簡體是丑,繁體「醜」的簡化。但地支的「丑」是正字,不應轉成醜。干:簡體是干,繁體「乾」或「幹」的簡化。但天干的「干」是正字。台、后、里:這些字在特定語境下是繁體正字,不能一律轉成臺、後、裡。
如果用「這個字轉繁體之後會不會變」當判準,這些正字全部會被誤判成簡體。這是一個很常見的邏輯錯誤。
轉換器的反向問題
字形轉換的麻煩不止一個方向。以 OpenCC 為例,它的字典有時會把臺灣地區的正字映到異體字。例如:
床被映到牀灶被映到竈群被映到羣雇被映到僱
在臺灣教育部《國語辭典》裡,床、灶、群、雇 都是收錄的正字。照字典判的話,這些正字反而被當成簡體處理了。這說明一件事:判斷一個字形對不對,最終要看該地區辭典收的是哪一個,不能只看轉換器的輸出。
怎麼處理這個問題
對於繁體中文網站而言,大模型產出的內容需要經過人工或工具校對。校對的重點不是「有沒有簡體字」,而是分辨三種情況:
- 純粹的簡體字(如
这、个、说):這些字在繁體語境裡沒有正字身分,出現就是錯。 - 身分模糊的正字(如
云、丑、干):需要看上下文才能判斷,不能用簡單的字形對照表處理。 - 轉換器的過度修正(如
床被改成牀):反過來,原本正確的字形被轉成異體字,也需要攔截。
本站的易錯字條目整理了一簡多繁的常見案例(例如地支的丑、天干的干),每一條附辭典出處。⚠️ 至於「轉換器把正字映到異體字」那一類(床、灶、群、雇),目前還沒有收進條目 —— 那是另一種成因,需要逐條查辭典才能定。檢測工具的設計邏輯也是圍繞這三種情況展開,而不是單純比對簡繁字形。
本篇名詞
這篇對你有幫助嗎?
分享這一篇
微信
用微信掃這個碼開啟本頁,再用微信自己的「分享」。⚠️ 微信不提供網頁分享連結,這是唯一的路。