词汇能力与自动化能力检测:评估频率、语境和语义的效用

《Applied Corpus Linguistics》:Lexical Proficiency and Automated Proficiency Detection: Assessing the Utility of Frequency, Context, and Semantics

【字体: 时间:2026年09月09日 来源:Applied Corpus Linguistics 4.3

编辑推荐:

   ## 摘要 本研究探讨了词汇丰富度指标在语言水平检测中的效用。特征提取自两种不同的词汇组织理论框架:基于重复的框架和基于语境的框架。研究者从EFCAMDAT语料库中选取学习者数据,并按话题进行子采样平衡,随后使用弹性网络正则化逻辑回归对相邻CEFR级别进行分类。单独建模时,

  

## 摘要

本研究探讨了词汇丰富度指标在语言水平检测中的效用。特征提取自两种不同的词汇组织理论框架:基于重复的框架和基于语境的框架。研究者从EFCAMDAT语料库中选取学习者数据,并按话题进行子采样平衡,随后使用弹性网络正则化逻辑回归对相邻CEFR级别进行分类。单独建模时,具有更广泛语料库覆盖范围词频指标部分优于计算方式更多样的基于语境和语义的指标。联合建模时,模型表现超过单独模型,接近甚至改进了先前报告的语言水平检测性能。模型中重要特征主要代表语境多样性/语义多样性(CD/SD)指标、语境冗余度和词汇强度,而词汇丰富度研究中更常依赖的指标则明显表现不佳。本研究为理论指导下的特征选择方法提供了启发,同时突显了亟需探索的指标和语料库来源(如社交媒体),为未来词汇丰富度和语言水平检测研究及应用提供了方向。

## 引言

第二语言(L2)学习者语料库的可获取性不断提高,使得对L2语言水平的大规模定量研究日益可行(Granger等,2007;Kyle,2021;Meurers,2015)。横断式学习者语料库包含L2不同发展阶段的学习者产出数据(Gilquin,2020),是自动语言评估(ALA)和自动作文评分(AES)发展的核心基础——这两者均依赖大规模学习者产出数据来建模语言水平。ALA和AES研究通过识别最能准确分类学习者语言水平的语言特征(如Gaillat等,2022),或最能解释人类评分者对学习者表现评分变异性的特征(如Kyle与Eguchi,2023),来探索自动化语言评估的计算方法(Lu & Bluemel,2020)。虽然这些系统已被纳入标准化测试,作为独立系统或与人工评分者结合使用(Beigman Klebanov & Madnani,2020;Ifenthaler,2023),但自动化方法也已被研究用于提升教学效能,以应对如同质化分组学习者或支持评估与反馈等教学挑战(Arnold等,2019;Ballier等,2019;Vajjala,2018)。自动化方法对于评估词汇水平也尤为重要,因为可以通过三角验证词汇测试(可能无法捕捉产出能力;Edmonds等,2022;Fitzpatrick,2007)和人工评分(可能无法隔离语言产出的离散成分;Fritz & Ruegg,2013)等方法来互补。简言之,虽然自动化方法在标准化评估之外的教学应用中具有潜力,但其效用和可解释性关键取决于词汇指标在多大程度上反映了词汇加工和发展的有意义方面。预测方法在开发此类自动化系统和测试词汇指标的教学应用中同样至关重要,因为它提供了超越群体差异的个体层面预测。

词汇水平作为语言水平的组成部分,其理论基础在于基于使用的语言习得观点,该观点将词汇存储和提取与语言经验联系起来(Bybee,2007;N. C. Ellis & Wulff,2020;R?mer,2024;Tomasello,2005),且词汇水平的衡量指标已被证明能越来越可靠地预测L2语言水平(Kyle等,2018;Kyle & Crossley,2015;Laufer & Nation,1995;Masrai,2023;Zareva等,2005)。

虽然语言水平检测研究已纳入了一系列代表词汇复杂度客观决定因素的特征(见Bulté & Housen,2012),但鲜有研究系统比较基于重复的词汇组织框架(即基于忽略语境属性的出现总计数)和基于语境的词汇组织框架(即基于纳入语境属性的衡量方式)各指标的表现(Chang等,2023)。尽管现有的语言水平检测研究已纳入语境指标并取得了令人振奋的发现(Eguchi & Kyle,2020;Kim等,2018;Kyle & Eguchi,2021;Monteiro等,2020),但其使用范围主要局限于工具生成的特征集(Kyle等,2018),迄今为止,这些特征集对近期开发和验证的语境指标覆盖有限。

因此,本研究通过独立评估每种框架并考察联合建模时各框架的相对贡献,为语言水平检测提供了基于重复的指标与语境指标之间的新颖比较。本研究的贡献在于展示了理论指导的特征集中相对未经检验和探索不足的指标在语言水平检测研究中的预测效用。

以下总结了词汇水平和词汇丰富度在语言水平检测中的角色,以及促使词频和语境指标比较的词汇组织理论框架。

词汇水平长期以来被视为理解和评估语言水平的核心方面(Bulté等,2008;Engber,1995;Laufer & Nation,1995;Olson,2024;Zareva等,2005)。作为一种行为构念,词汇水平反映语言学习者有效使用目标语词汇的能力(Leńko-Szymańska,2020)。Leńko-Szymańska(2019)扩展了Bulté等(2008)的框架,通过词汇产出的三个指标操作化词汇水平:复杂度、准确性和流畅性。词汇丰富度代表词汇复杂度的一个维度,反映文本词汇组成的规模(即使用的词数)和广度(即使用的词汇类型和种类)。词汇丰富度也代表词汇流畅性的一个维度,反映程序性能力(即产出就绪的词汇提取程度)。虽然已提出多种词汇丰富度的操作化方法(综述见Leńko-Szymańska,2019),但与基于频带的方法相比(Crossley, Cobb等,2013),基于计数的方法在语言水平分类中展现了更优性能。基于频带的方法识别文本中落在传统定义的频带范围内的比例(如词族第一千词带中的词占比)。相比之下,基于计数的方法依赖连续值,使用由词-值对组成的词汇指标来生成文本词汇组成的一维数值表示(Kyle等,2018;Lu,2014)。多个指标随后产生多维表示。研究表明,此类方法能解释书面作文水平分数的相当大变异(Kyle等,2018),并越来越多地被探索以更好地反映词汇丰富度的多维特性(Eguchi & Kyle,2020;Kim等,2018)。

词汇指标包含的值来源于主观词评分(如具体性、熟悉度、习得年龄)或从参考语料库中提取的客观衡量方式(如词频、分布范围、语义区别度)。虽然主观词评分提供了有价值的见解,但已有研究表明,在配合更高质量的客观指标建模时,它们对词命名和词汇决策表现解释的变异更少(Brysbaert & Cortese,2011)。客观衡量方式通常被认为可靠且可重复,因为它们通过定量和自动方式得出(如Marelli & Amenta,2018;McDonald & Shillcock,2001)。然而,需要进行审慎考量。参考语料库的选择可能对判别性能产生重大影响(Tidball & Treffers-Daller,2007)。同样,源自相似语料库来源的指标在解释力方面也可能因所采用的计算方法不同而有显著差异(如分布范围、语境区别度和语义多样性;见Hashimoto & Egbert,2019)。这种对语料库来源和计算方法选择的敏感性,使得采用多维方法的重要性更为突出——这些方法通过降维(Eguchi & Kyle,2020;Kim等,2018)或正则化(Arnold等,2019;Gaillat等,2022)来处理多重共线性和共享变异。鉴于Eguchi和Kyle(2020)所指出的指标创建和验证数量不断扩展,这一需求尤为迫切。在竞争的词汇组织框架之间选择指标,为比较受限但内部有变化的特征集提供了理论依据。例如,尽管词频(WF)仍是语言水平检测研究中的常用指标,但语境指标捕捉了词汇在出现语境中的分布和关联方式。然而,目前仅有有限范围的语境和语义指标(CD/SD)被研究过,且迄今为止尚无研究系统评估过大量CD/SD指标。

词频(WF)或词元频率是词汇提取、可获得性或稳固性的常见衡量方式(Ellis,2002, 2021),已被证明会扭曲这些词汇强度组成部分(见Bybee,2007),因为它忽略了语料库之间和语料库内部的变异性(Egbert等,2020;Gries,2022)。此外,以WF操作化的基于重复的词汇组织框架的理论合理性也受到了质疑。Adelman等(2006)和Adelman & Brown(2008)证明,基于一个词出现的不同语境(即不同文档)数量的指标——语境多样性(CD)或分布范围——在解释词汇决策时间(LDTs)和词命名时间(NT)方面比WF解释了更多的变异。但值得注意的是,CD是一个相对有限的衡量方式,它仅捕捉一个词出现在多少个语境中,而忽略了在这些语境中出现的频率。记忆和可能需求原则的合理分析(Anderson & Milson,1989;Ellis,2006;Schooler & Anderson,1997)为基于语境的词汇组织框架提供了基于使用的解释:一个词在新的未来语境中的可能需求由其遇到的语境决定。这一推理进一步通过分布式语义模型(DSM)进行了探索,如潜在语义分析(LSA: Landauer等,1998)、累积语言环境边界编码(BEAGLE: Jones & Mewhort,2007)和Word2Vec(Mikolov等,2013)。DSM捕捉反映词汇语义关系的统计规律(Günther等,2019;Jones等,2015)。Jones等(2012)和Johns & Jones(2022)证明,虽然CD始终优于WF,但利用DSM考虑跨语境的语义冗余进一步改善了与行为数据的拟合,结论是语境多样性指标必须考虑语义内容(另见Chang等,2023)。

虽然已有研究探讨CD在语言水平检测中的作用,并发现它们是作文分数的显著预测因子(如Kim等,2018;Monteiro等,2020),但探索超出CD范围的更多样CD/SD指标的研究较少。Kyle & Eguchi(2021)发现McDonald & Shillcock(2001)的语境区别度指标(McD CD)是整体作文分数的最强预测因子,Eguchi & Kyle(2023)则发现Hoffman等(2013)的语义多样性指标(SemD)是解释整体面试分数变异的最佳词汇指标集的关键贡献者,在CD和其他词汇指标之外增加了解释力。

遗憾的是,除McD CD和SemD外,数量可观的CD/SD指标尚未在语言水平检测研究中进行测试——而这两个指标均源自单一语料库来源,即英国国家语料库(BNC: Leech等,2001)。这一限制值得关注,因为已有研究表明CD/SD指标在次优语料库来源上训练时表现不佳(Chang等,2023;Osth等,2020)。在基于使用的假设下,利用新颖语料库来源和语境新方法扩展可能需求原则的最新发展(Johns,2021;Johns等,2020)尚未在语言水平检测研究中得到广泛应用。鉴于已有证据表明双语者对语义多样性信息的敏感度高于单语者(Johns等,2016),这一点尤其值得关注。不出所料,学界已呼吁进一步研究这一空白(Crossley, Subtirelu等,2013)。

本研究在此基础上,沿袭了语言水平检测和词汇水平研究的先前工作,聚焦于两种不同的词汇组织框架。遵循Chang等(2023)的方法,基于重复的框架以WF指标操作化,而语境框架(CD/SD)以CD以外的指标操作化。与前序基于分类的方法(Arnold等,2019;Gaillat等,2022)一致,本研究采用弹性网络逻辑回归。本研究针对两个主要研究问题,评估当前可获取的WF和CD/SD指标在语言水平检测中的效用:

- **RQ1**:WF和CD/SD指标在多大程度上能准确分类L2词汇水平作为语言水平的组成部分?
- **RQ2**:在正则化下联合建模时,WF和CD/SD指标在相对重要性上有何差异?

## 章节摘要

### 学习者语料库数据

本研究选择经过修改的English First Cambridge开放语言数据库(EFCAMDAT)(Geertzen等,2014;Shatz,2020)作为开放获取的大规模准纵向L2学习者数据语料库。学习者作为EF课程的一部分,在每个单元结束后提交对任务提示的书面回答(16个级别共8个单元),涵盖一般话题(如通过电子邮件介绍自己;给出玩游戏的说明)。在两个可用的数据集中,选择了"main prompts"数据集,原因是……

### 结果

为回答RQ1,表4展示了调优后的模型参数及训练/测试性能概览。

正则化参数α表明模型从弹性网络(0 < α < 1)所代表的L1与L2惩罚均衡状态,到严格的L1惩罚(α = 1),再到以L2惩罚为主的模式(α ≈ 0)。参数λ表明所有模型均受到了正则化(λ > 0)。最后,训练集与测试集AUC得分之间的相似性表明,模型能够良好泛化,未出现对WF和CD/SD的显著过拟合。WF和CD/SD分别建模:尽管WF在行为测量中一贯表现不如CD/SD,但在本熟练度检测任务中,WF在两个最低熟练度水平对比(A1/A2和A2/B1)以及最高熟练度水平对比(B2/C1)中均显著优于CD/SD。更广泛的语料库覆盖可能使WF相较于计算方式更多样的CD/SD指数具有优势。简言之,在正则化条件下,WF模型更能有效分配权重于各水平中贡献最大的指数。结论:本研究在理论指导的特征选择方法下,评估了WF和CD/SD指数在熟练度检测中的效用。分别建模时,WF因受益于更广泛的语料库覆盖,在三个熟练度对比(A1/A2、A2/B1和B2/C1)中显著优于CD/SD,而在B1/B2对比中无统计学差异。联合建模时,来自较新方法(如语境冗余和词汇强度)的指数以及来自近期开发的语料库(如社交媒体)的指数……CRediT作者贡献声明:Anton Vegel:撰写—审阅与编辑、撰写—初稿、验证、形式化分析、数据整理、概念构思。Anton Vegel
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号