AI 写的繁体中文为什么会混进简体字
发布于 2026-08-04 · 约 5 分钟 ·作者:華智匯編輯部
有一批字同时是简体字形与独立的繁体正字(云、丑、干、台、后、里),所以「转成繁体会不会变」这个判准会把这些正字误判为简体。
大模型产出繁体的机制
目前主流大模型在处理中文时,底层的训练数据以简体中文占大宗。这代表模型在「学会」中文的过程中,主要接触的是简体字形与简体语料。当用户要求繁体中文输出时,模型做的事情不是「用繁体思考」,而是在生成之后进行一次字形映射——把简体字形转换成对应的繁体字形。
这个过程本身就不稳定。映射依赖的是模型内化的一套对照表,而非一套有明确规则的转换引擎。当模型对某个字的映射信心不足,或上下文没有提供足够线索时,它可能直接保留简体字形,不做转换。
单字渗入:最常见的失败模式
大模型混入简体的方式,通常不是整段变成简体,而是单字渗入。一段正确的繁体散文里,偶尔会出现一两个简体字形,像是 这(对应「这」)、个(对应「个」)、说(对应「说」)。这种错误很难用肉眼扫过就发现,因为读者的眼睛会自动补全。
真正的简体混入很少只有一个字。一旦模型在某处滑进简体模式,这、个、时、说、国 这些没有繁体身分的字形会接连出现。它们是纯粹的简体字,在任何繁体辞典里都找不到。
身分模糊的字:转换器的陷阱
更棘手的问题不在于那些「一看就是简体」的字,而在于那些身分模糊的字。有些字形同时是简体字,也是独立的繁体正字。这些字不能用「转成繁体之后会不会变」来判断,因为它们不需要变——它们本来就是正确的。
常见的例子包括:
云:简体是云,繁体「云」的简化。但「人云亦云」里的云是正字,不是简体。丑:简体是丑,繁体「丑」的简化。但地支的「丑」是正字,不应转成醜。干:简体是干,繁体「干」或「干」的简化。但天干的「干」是正字。台、后、里:这些字在特定语境下是繁体正字,不能一律转成臺、後、裡。
如果用「这个字转繁体之后会不会变」当判准,这些正字全部会被误判成简体。这是一个很常见的逻辑错误。
转换器的反向问题
字形转换的麻烦不止一个方向。以 OpenCC 为例,它的字典有时会把台湾地区的正字映到异体字。例如:
床被映到牀灶被映到竈群被映到羣雇被映到僱
在台湾教育部《国语辞典》里,床、灶、群、雇 都是收录的正字。照字典判的话,这些正字反而被当成简体处理了。这说明一件事:判断一个字形对不对,最终要看该地区辞典收的是哪一个,不能只看转换器的输出。
怎么处理这个问题
对于繁体中文网站而言,大模型产出的内容需要经过人工或工具校对。校对的重点不是「有没有简体字」,而是分辨三种情况:
- 纯粹的简体字(如
这、个、说):这些字在繁体语境里没有正字身分,出现就是错。 - 身分模糊的正字(如
云、丑、干):需要看上下文才能判断,不能用简单的字形对照表处理。 - 转换器的过度修正(如
床被改成牀):反过来,原本正确的字形被转成异体字,也需要拦截。
本站的易错字条目整理了一简多繁的常见案例(例如地支的丑、天干的干),每一条附辞典出处。⚠️ 至于「转换器把正字映到异体字」那一类(床、灶、群、雇),目前还没有收进条目 —— 那是另一种成因,需要逐条查辞典才能定。检测工具的设计逻辑也是围绕这三种情况展开,而不是单纯比对简繁字形。
本篇名词
这篇对你有帮助吗?
分享这一篇
微信
用微信扫这个码打开本页,再用微信自己的「分享」。⚠️ 微信不提供网页分享链接,这是唯一的路。