華智匯
繁體中文 简体中文 English

AI 寫的繁體中文為什麼會混進簡體字

發布於 2026-08-04 · 約 5 分鐘 ·作者:華智匯編輯部

有一批字同時是簡體字形與獨立的繁體正字(云、丑、干、台、后、里),所以「轉成繁體會不會變」這個判準會把這些正字誤判為簡體。

大模型產出繁體的機制

目前主流大模型在處理中文時,底層的訓練資料以簡體中文佔大宗。這代表模型在「學會」中文的過程中,主要接觸的是簡體字形與簡體語料。當使用者要求繁體中文輸出時,模型做的事情不是「用繁體思考」,而是在生成之後進行一次字形映射——把簡體字形轉換成對應的繁體字形。

這個過程本身就不穩定。映射依賴的是模型內化的一套對照表,而非一套有明確規則的轉換引擎。當模型對某個字的映射信心不足,或上下文沒有提供足夠線索時,它可能直接保留簡體字形,不做轉換。

單字滲入:最常見的失敗模式

大模型混入簡體的方式,通常不是整段變成簡體,而是單字滲入。一段正確的繁體散文裡,偶爾會出現一兩個簡體字形,像是 (對應「這」)、(對應「個」)、(對應「說」)。這種錯誤很難用肉眼掃過就發現,因為讀者的眼睛會自動補全。

真正的簡體混入很少只有一個字。一旦模型在某處滑進簡體模式, 這些沒有繁體身分的字形會接連出現。它們是純粹的簡體字,在任何繁體辭典裡都找不到。

身分模糊的字:轉換器的陷阱

更棘手的問題不在於那些「一看就是簡體」的字,而在於那些身分模糊的字。有些字形同時是簡體字,也是獨立的繁體正字。這些字不能用「轉成繁體之後會不會變」來判斷,因為它們不需要變——它們本來就是正確的。

常見的例子包括:

如果用「這個字轉繁體之後會不會變」當判準,這些正字全部會被誤判成簡體。這是一個很常見的邏輯錯誤。

轉換器的反向問題

字形轉換的麻煩不止一個方向。以 OpenCC 為例,它的字典有時會把臺灣地區的正字映到異體字。例如:

在臺灣教育部《國語辭典》裡, 都是收錄的正字。照字典判的話,這些正字反而被當成簡體處理了。這說明一件事:判斷一個字形對不對,最終要看該地區辭典收的是哪一個,不能只看轉換器的輸出。

怎麼處理這個問題

對於繁體中文網站而言,大模型產出的內容需要經過人工或工具校對。校對的重點不是「有沒有簡體字」,而是分辨三種情況:

  1. 純粹的簡體字(如 ):這些字在繁體語境裡沒有正字身分,出現就是錯。
  2. 身分模糊的正字(如 ):需要看上下文才能判斷,不能用簡單的字形對照表處理。
  3. 轉換器的過度修正(如 被改成 ):反過來,原本正確的字形被轉成異體字,也需要攔截。

本站的易錯字條目整理了一簡多繁的常見案例(例如地支的丑、天干的干),每一條附辭典出處。⚠️ 至於「轉換器把正字映到異體字」那一類(床、灶、群、雇),目前還沒有收進條目 —— 那是另一種成因,需要逐條查辭典才能定。檢測工具的設計邏輯也是圍繞這三種情況展開,而不是單純比對簡繁字形。

本篇名詞

地支
子丑寅卯辰巳午未申酉戌亥,共十二個。四柱裡每一柱下面那個字。
天干
甲乙丙丁戊己庚辛壬癸,共十個。四柱裡每一柱上面那個字。

看全部名詞解釋 →

用你自己的生辰試一次

本站的排盤會處理出生地、歷史夏令時與真太陽時 —— 那正是這篇文章在講的東西。

開始排盤

這篇有錯字或事實錯誤?告訴我們

分享這一篇

微信

用微信掃這個碼開啟本頁,再用微信自己的「分享」。⚠️ 微信不提供網頁分享連結,這是唯一的路。