华智汇
繁體中文 简体中文 English

AI 写的繁体中文为什么会混进简体字

发布于 2026-08-04 · 约 5 分钟 ·作者:華智匯編輯部

有一批字同时是简体字形与独立的繁体正字(云、丑、干、台、后、里),所以「转成繁体会不会变」这个判准会把这些正字误判为简体。

大模型产出繁体的机制

目前主流大模型在处理中文时,底层的训练数据以简体中文占大宗。这代表模型在「学会」中文的过程中,主要接触的是简体字形与简体语料。当用户要求繁体中文输出时,模型做的事情不是「用繁体思考」,而是在生成之后进行一次字形映射——把简体字形转换成对应的繁体字形。

这个过程本身就不稳定。映射依赖的是模型内化的一套对照表,而非一套有明确规则的转换引擎。当模型对某个字的映射信心不足,或上下文没有提供足够线索时,它可能直接保留简体字形,不做转换。

单字渗入:最常见的失败模式

大模型混入简体的方式,通常不是整段变成简体,而是单字渗入。一段正确的繁体散文里,偶尔会出现一两个简体字形,像是 (对应「这」)、(对应「个」)、(对应「说」)。这种错误很难用肉眼扫过就发现,因为读者的眼睛会自动补全。

真正的简体混入很少只有一个字。一旦模型在某处滑进简体模式, 这些没有繁体身分的字形会接连出现。它们是纯粹的简体字,在任何繁体辞典里都找不到。

身分模糊的字:转换器的陷阱

更棘手的问题不在于那些「一看就是简体」的字,而在于那些身分模糊的字。有些字形同时是简体字,也是独立的繁体正字。这些字不能用「转成繁体之后会不会变」来判断,因为它们不需要变——它们本来就是正确的。

常见的例子包括:

如果用「这个字转繁体之后会不会变」当判准,这些正字全部会被误判成简体。这是一个很常见的逻辑错误。

转换器的反向问题

字形转换的麻烦不止一个方向。以 OpenCC 为例,它的字典有时会把台湾地区的正字映到异体字。例如:

在台湾教育部《国语辞典》里, 都是收录的正字。照字典判的话,这些正字反而被当成简体处理了。这说明一件事:判断一个字形对不对,最终要看该地区辞典收的是哪一个,不能只看转换器的输出。

怎么处理这个问题

对于繁体中文网站而言,大模型产出的内容需要经过人工或工具校对。校对的重点不是「有没有简体字」,而是分辨三种情况:

  1. 纯粹的简体字(如 ):这些字在繁体语境里没有正字身分,出现就是错。
  2. 身分模糊的正字(如 ):需要看上下文才能判断,不能用简单的字形对照表处理。
  3. 转换器的过度修正(如 被改成 ):反过来,原本正确的字形被转成异体字,也需要拦截。

本站的易错字条目整理了一简多繁的常见案例(例如地支的丑、天干的干),每一条附辞典出处。⚠️ 至于「转换器把正字映到异体字」那一类(床、灶、群、雇),目前还没有收进条目 —— 那是另一种成因,需要逐条查辞典才能定。检测工具的设计逻辑也是围绕这三种情况展开,而不是单纯比对简繁字形。

本篇名词

地支
子丑寅卯辰巳午未申酉戌亥,共十二个。四柱里每一柱下面那个字。
天干
甲乙丙丁戊己庚辛壬癸,共十个。四柱里每一柱上面那个字。

看全部名词解释 →

用你自己的生辰试一次

本站的排盘会处理出生地、历史夏令时与真太阳时 —— 那正是这篇文章在讲的东西。

开始排盘

这篇有错字或事实错误?告诉我们

分享这一篇

微信

用微信扫这个码打开本页,再用微信自己的「分享」。⚠️ 微信不提供网页分享链接,这是唯一的路。