《Frontiers in Artificial Intelligence》:Faithful or evasive? An empirical study on translation norm preferences of Chinese and American LLMs in Chinese official political and policy discourse
编辑推荐:
摘要
引言:大语言模型现在承担了跨语言政治翻译的一部分工作,但尚无研究直接测量它们在翻译时是否遵循稳定的规范性偏好。
方法:研究人员聚焦于嵌入真实官方话语的中国政治与政策术语的中译英翻译。对翻译理论、大语言模型实证研究和AI对齐三个领域的52篇文献进行系统
摘要
引言:大语言模型现在承担了跨语言政治翻译的一部分工作,但尚无研究直接测量它们在翻译时是否遵循稳定的规范性偏好。
方法:研究人员聚焦于嵌入真实官方话语的中国政治与政策术语的中译英翻译。对翻译理论、大语言模型实证研究和AI对齐三个领域的52篇文献进行系统映射,构建了五维翻译规范取向(Translation Norm Orientations, TNO)框架:忠实度规范(Faithfulness Norm, FN)、流畅度规范(Fluency Norm, FLN)、文化适应规范(Cultural Adaptation Norm, CAN)、伦理对冲规范(Ethical Hedging Norm, EHN)和异化保留规范(Foreignization Retention Norm, FRN)。八个主流中美大语言模型在20个意识形态敏感的政治术语上完成强制选择翻译排序任务(Forced-Choice Translation Ranking Task, FCTRT),每个术语在三次重复试验中进行排序。采用Kendall's W评估排序稳定性,Mann–Whitney U检验配合BH-FDR校正检验组间差异,层次聚类识别潜在规范原型。
结果:全部八个模型均将FN排在首位;CAN、EHN和FRN在其下方形成一个共享的低优先级区间。五个维度均未显示出统计学显著的CN–US差异。仅FN呈现中等效应量(Cliff's δ = 0.50),表明两组差异体现在倾向强度而非方向上。聚类成员跨越国别界限而非沿国界分布:浮现出四个跨国模型特征,其区分主要依据异化容忍度而非开发者地理归属。
讨论:这些结果将翻译规范理论与AI评估相联系,并提供了一个可供其他研究者复用的基准,以考察LLM中介的政治传播。
**论文解读:中美大语言模型政治话语翻译规范偏好的实证研究**
**一、研究背景与问题提出**
翻译并非代码的透明转换。在描述性翻译研究(Descriptive Translation Studies, DTS)传统中,翻译规范构成分析译者如何在充分性与可接受性之间协商张力的核心框架,这种协商映射了特定社会文化语境中深层的权力结构(Toury, 1995)。当翻译主体从文化情境中的人类译者转变为由数十亿参数化的概率系统——大语言模型(Large Language Models, LLMs)时,这一基础前提面临本体论断裂:传统的动机探究和民族志访谈等研究工具丧失了认识论基础。
这一转变的实践影响相当可观。主流LLM在通用语言对上的翻译能力已可与专业译者比肩(Hendy et al., 2023; Jiao et al., 2023),并正渗透至新闻和政府事务等垂直领域(Hu and Li, 2023)。由此产生一个根本性问题:这些模型在翻译政治敏感文本时,是否表现出稳定且可观测的排序倾向?
已有证据支持这一关切。Ma et al.(2026)揭示对齐策略内隐地编码了价值层级,而政治话语翻译作为跨语言权力争夺的场域,其规范选择与文化霸权存在结构性关联(Baker, 2018a; Venuti, 2017)。Wen和Tian(2024)记录了ChatGPT对具有鲜明中国特色的话语进行系统性语义稀释的现象,Yu和Liu(2024)观察到AI正在积极重构跨语言话语权力分布。然而,中美模型在政治话语翻译中倾向于保留还是弱化意识形态张力,仍属实证空白。多数研究局限于定性的单一模型分析,或脱离具体翻译场景的抽象价值测量(Sühr et al., 2025; Wang and Xie, 2024),而对自发输出的事后评估无法隔离特定规范取向对翻译决策的因果贡献。
基于此,本研究以中国官方政治与政策话语中的术语中译英为对象,提出翻译规范取向(Translation Norm Orientations, TNO)作为核心构念,以及强制选择翻译排序任务(Forced-Choice Translation Ranking Task, FCTRT)作为测量工具,回答三个研究问题:RQ1:中美LLM在翻译中国政治与政策术语时是否表现出稳定可观测的排序倾向,这些倾向在五个TNO维度上如何分布?RQ2:排序偏好是否存在统计学显著的组间差异,这些差异是否集中于特定维度或特定敏感术语?RQ3:规范偏好聚类是否与CN–US地缘政治边界一致,抑或主要由训练数据和对齐策略驱动,从而呈现跨国描述性模型特征?
**二、研究方法与关键技术**
本研究采用受控实验设计,以FCTRT为核心测量工具。研究语料包含20个源自真实官方话语语境的中国政治与政策术语,每项配以五个分别对应TNO五维度的译文选项,嵌入完整英文句子框架中呈现。语料构建采用三步双盲程序,由两名博士级翻译学者独立验证,经专家效度确认,所有选项的可接受度评分均≥3.5(M = 4.12, SD = 0.58)。模型选择涵盖中国四个商业LLM(DeepSeek-V3.2、Kimi-2.5、Qwen-3.5、ERNIE 5.0)和美国四个商业LLM(Claude Sonnet 4.6、GPT-5.3、Gemini-3.1-Pro、Grok 4.2),均通过官方API于2026年3月至4月间访问。实验采用拉丁方设计轮换选项顺序,每项重复三轮。统计分析包括Kendall's W评估排序稳定性、Mann–Whitney U检验(配合BH-FDR校正和Cliff's δ效应量)检验组间差异,以及Ward联结层次聚类识别潜在规范原型。
**三、研究结果**
**3.1 翻译规范偏好的总体模式**
八个模型的总体排序层级为:FN(M = 1.40)> FLN(M = 2.65)> CAN(M = 3.62)≈ EHN(M = 3.64)> FRN(M = 3.69)。最显著的特征是FN的零例外主导:每个模型均将其排在首位。这种一致性可从两个层面解释:在学科延续层面,形式对等传统将源语语义完整性视为首要约束,预训练语料库中专业平行文本已编码了忠实度偏好;在任务设计层面,忠实度选项具有最低的语义偏离风险,构成“最小遗憾”选择。
**3.2 话语类型对规范优先级的调节效应**
经典政治术语(O类)与新兴政策术语(N类)在两个维度上出现分化:EHN从O类的M = 3.52升至N类的3.77(+0.25),FLN则从2.80降至2.48。新兴政策词汇缺乏既定英文对应,模型既无法找到成熟的归化目标,也难以诉诸音译,使语义弥散性对冲选项成为相对易达路径;经典术语则经数十年双语实践积累了稳定对应,降低了流畅度成本。
**3.3 排序稳定性**
全部八个模型均达到可接受的Kendall's W一致性水平(每模型稳定项数11/20–20/20,平均W范围0.750–0.913)。美国组平均稳定性(M_W = 0.891)略高于中国组(0.815),但更关键的对比在于离散度:美国模型高度同质,中国模型内部差异显著——ERNIE 5.0(19/20)与Qwen-3.5(11/20)之间相差八项。
**3.4 组间比较**
五个维度均未达到统计显著性(BH-FDR校正后q = 1.000)。FN维度呈中等至较大效应量(Cliff's δ = 0.50),美国组中位数(1.291)略低于中国组(1.498),表明差异在于偏好强度而非方向。EHN的组间差异为所有维度最小(CN中位数3.566,US 3.571,Cliff's δ = 0.000),接近完全一致。
**3.5 聚类结构与描述性模型特征**
层次聚类显示聚类并不沿CN–US地缘政治边界对齐,而是浮现出显著的跨国混合聚类。最紧密配对为Grok 4.2(US)与ERNIE 5.0(CN)。模型间FRN方差远超其他四维,使异化容忍度成为主要分化轴。聚类热图勾勒出四个暂定原型:形式保持型(Grok 4.2、ERNIE 5.0)、忠实-规避型(GPT-5.3、Gemini-3.1-Pro、Kimi-2.5)、忠实-流畅平衡型(Claude Sonnet 4.6、Qwen-3.5)和忠实-适应型(DeepSeek-V3.2)。
**四、讨论与结论**
本研究通过TNO框架和FCTRT,对八个中美LLM在20个意识形态敏感的中国政治与政策术语上的可观测排序倾向进行了探索性评估。忠实度规范占据结构性主导地位;文化适应、伦理对冲和异化保留聚集于共享的低优先级区间。未出现统计学显著的跨国差异;聚类产生四个跨国初步描述性特征,以异化容忍度而非地理归属为分化依据。当前LLM在国别起源上趋同为忠实翻译工具,同时保留着值得持续关注的话语敏感变异。
研究存在六项局限性:模型样本(n = 8)不足以支撑推断性统计功效;语料限于20个中国官方政治与政策术语,推广性受限;未与人类专业译者排序或自动质量指标进行交叉验证;统一“翻译质量”锚定可能无法完全排除质量与忠实度的隐含等同;静态快照设计无法捕捉规范漂移;强制选择范式无法检测仅在自由生成中浮现的规范倾向。据此提出六个未来研究方向:规模复制、跨领域扩展、人机三角验证、纵向监测、多标准设计和自由生成配对。