《Information Processing & Management》:CulturalProbe: Probing Multilingual LLM Capabilities and Limitations for Cultural Understanding in Low-Resource Languages
编辑推荐:
•CulturalProbe:一项针对低资源语言文化评估的新基准。•大语言模型(LLMs)在英语与埃塞俄比亚语言之间的性能差距达27分。•模型会混淆文化,在40%的失败案例中用阿姆哈拉语替代提格雷尼亚语。•专门的多语言训练优于更大规模的通用大语言模型。•随着模型能力提升,多选
- •
CulturalProbe:一项针对低资源语言文化评估的新基准。
- •
大语言模型(LLMs)在英语与埃塞俄比亚语言之间的性能差距达27分。
- •
模型会混淆文化,在40%的失败案例中用阿姆哈拉语替代提格雷尼亚语。
- •
专门的多语言训练优于更大规模的通用大语言模型。
- •
随着模型能力提升,多选题任务中的位置偏差逐渐减小。
引言
计算文化理解涉及构建能够识别、适应并在不同社会多样的情感、社交和文化规范中运行的自然语言处理(NLP)技术(Hershcovich等人,2022年)。虽然GPT-4、Claude和LLaMA等大语言模型(LLMs)通过使机器能够生成类人文本和理解多种语言,彻底改变了NLP领域,但其性能仍然严重偏向高资源语言(Achiam等人,2023年;Gallifant等人,2024年)。尽管模型在英语等广泛使用的语言上得到了广泛评估,但它们在缺乏大规模训练数据的低资源语言中的能力仍然严重未被充分探索(Myung等人,2024年)。更根本的是,文化理解远不止语言熟练度。它要求模型理解和恰当地推理特定文化概念、社会仪式、价值体系以及社区内部沟通中不成文的规范(AlQurashi,2013年)。为了让大语言模型在多样的语言社区中有效发挥作用,它们必须超越直接翻译,主动解读文化语境,这一挑战在本研究所考察的埃塞俄比亚语言中尤为明显(Singh等人,2024年)。在此领域已经出现一个令人担忧的模式:模型有时会在收到阿姆哈拉语请求时生成提格雷尼亚语谚语,将训练中同时存在的两种不同的埃塞俄比亚文化混为一谈。这种行为表明,多语言架构中文化知识组织和检索方式存在关键缺口。
针对低资源语言中文化理解的NLP研究仍然有限。现有基准如MMLU(Hendrycks等人,2020年)和MGSM(Shi等人,2022年)评估多语言事实和数学推理能力,而CultureBank(Arora等人,2023年)主要探究高资源语言中的价值观念。然而,目前缺乏对低资源语言景观中深层文化理解的系统评估。这一缺口尤为突出,因为低资源语言在用于预训练的网页抓取语料库中严重代表性不足。
隐性文化知识指的是社区成员通过社会化而非明确教导所获得的对文化规范、价值观和实践的隐性经验性理解。这种知识蕴含在谚语、成语和社会仪式中,但很少在教科书或参考资料中被系统编纂。对大语言模型而言,这尤其具有挑战性,因为它无法从训练语料库中的显性事实陈述中轻易提取。因此,谚语特别适合用于评估文化理解。与直接的事实陈述不同,谚语需要基于特定文化语境的隐喻推理,同时也要求识别关于价值观、社会等级和社区规范的不言自明的假设。这使文化推理区别于简单的记忆:即使模型在预训练期间接触过某个谚语,要正确解读其在语境中的含义,仍需推断无法从表面形式中得出的隐性文化假设。
需要指出的是,我们使用谚语针对的是文化理解的一个特定维度——谚语和隐喻推理——而非文化胜任力的完整广度,后者还包括社交互动规范、仪式实践和当代文化知识。例如,英语谚语"好名声胜过财富"强调诚信和道德品质比物质财富更有价值。虽然类似概念在不同文化中普遍存在,但其具体表述和内涵差异显著(Cecilia Liu等人,2024年)。在奥罗莫语(Afaan Oromo)中,一个等效的埃塞俄比亚谚语"Maqaan gaarii qabeenya caalaa gatii guddaa qaba"译为"良好声誉比物质财富具有更高价值",但承载着植根于特定社会和历史背景的鲜明文化内涵。成功解读此类谚语要求模型超越字面翻译,深入理解塑造其含义的隐性价值观。因此,基于谚语的任务表现提供了对深层文化理解的严格检验,将真正的语义理解与表层语言能力区分开来。
章节摘要
研究目标
基于引言中识别的研究缺口,本研究由以下研究目标(RO)指导:
- •
RO1:通过需要隐性文化知识的基于谚语的任务,系统评估多语言大语言模型在低资源语言中的文化理解能力。
- •
RO2:识别和表征多语言大语言模型在不同语言中表现出的文化错误模式,包括文化混淆、刻板印象和字面解读。
相关工作
本节回顾了文化感知NLP的理论基础和实证基础,重点关注低资源语境中的文化理解和语言建模。尽管文化仍是一个多维度的构建概念,NLP研究越来越多地通过特定语言社区中共同价值观、隐性规范和社会互动来操作化它(C.C. Liu等人,2025年)。
CulturalProbe数据集
本节详细介绍了构建CulturalProbe基准所使用的方法论和程序。
模型选择
我们选择了一系列涵盖不同规模和架构的多样化多语言大语言模型。选择标准涵盖四个维度:(1)参数量规模,(2)开放权重与专有可用性,(3)指令微调与基础配置,以及(4)明确的多语言训练目标与通用训练目标。这一横截面考察了架构和训练选择对文化推理的影响。
开放权重模型包括LLaMA 2(Touvron等人,
跨评估任务的系统比较
针对我们的第一个研究目标(RO1),表4总结了所有三项CulturalProbe任务的零样本模型性能。多选题任务、填空题任务和开放式生成任务使用不同的指标评分(MCT和FBT使用精确匹配准确率;生成任务使用ChrF),因此无法在共同尺度上直接比较。我们定性观察到,所有三项任务在埃塞俄比亚语言中都很困难,且开放式产出是
理论和实践意义
这些结果提供了自然语言处理与信息科学交叉领域的实证证据,揭示了在低资源语境中管理文化编码信息所面临的独特挑战。
从信息科学角度来看,本研究关注多语言大语言模型如何在低资源语言中处理文化知识。自动ChrF分数与人工评估之间的中等相关性()表明,字符级指标能够捕捉文化
讨论
这些发现揭示了多语言大语言模型在处理文化知识时的系统性局限性。
局限性
虽然本研究为理解多语言大语言模型的行为提供了有价值的洞察,但也并非没有局限性。首先,我们的数据集仅限于三种埃塞俄比亚语言和英语;将评估扩展到全球多样文化对于描绘这些差异如何普遍显现至关重要。其次,虽然数据收集依赖于埃塞俄比亚本地众包工作者,但使用机器翻译进行二次验证可能会引入微妙的偏差,尽管进行了严格的过滤
结论
在本研究中,我们调查了多语言大语言模型在低资源语言语境中的文化理解能力。为此,我们引入了CulturalProbe,一个基于谚语的、专门针对隐性文化知识的多语言探针基准。我们的发现表明,当前的多语言大语言模型在捕捉非英语语言的文化细微差别方面仍然显著表现不佳,证实了与英语表现之间存在的显著差距。
CRediT作者贡献声明
Geleta Negasa Binegde:撰写—初稿、验证、方法论、形式化分析、概念化。Huaping Zhang:监督、资源、项目管理。Qiuchi Li:撰写—审阅与编辑、监督、经费获取。Baohua Zhang:撰写—审阅与编辑。Chunxiao Gao:撰写—审阅与编辑、验证。Hagos Gebremedhin Gebremeskel:撰写—审阅与编辑。
利益冲突声明
作者声明他们没有已知的可能影响本论文所报告工作的竞争性经济利益或个人关系。
致谢
本研究得到了中国国家重点研发计划资助,项目编号SQ2024YFC3300144。
Geleta Negasa Binegde|Huaping Zhang|Qiuchi Li|Baohua Zhang|Chunxiao Gao|Hagos Gebremedhin Gebremeskel