Gate2Code:针对阿拉伯语表格式问答任务的难度感知规划与代码生成技术
《Electronics》:Gate2Code: Difficulty-Aware Planning and Code Generation for Arabic Tabular Question Answering
【字体:
大
中
小
】
时间:2026年09月04日
来源:Electronics 2.9
编辑推荐:
摘要
虽然大型语言模型(LLMs)在自由文本问题上的表现令人印象深刻,但它们在表格问答(Tabular QA)方面的可靠性仍然有限,尤其是在多步骤推理和数值聚合方面。在阿拉伯语环境中,这些问题因拼写差异、双重数字系统以及
摘要
虽然大型语言模型(LLMs)在自由文本问题上的表现令人印象深刻,但它们在表格问答(Tabular QA)方面的可靠性仍然有限,尤其是在多步骤推理和数值聚合方面。在阿拉伯语环境中,这些问题因拼写差异、双重数字系统以及隐形的Unicode错误而变得更加复杂,这些错误会干扰表格的匹配和结构化执行。虽然以代码为中心的处理流程可以通过执行生成的程序来减少算术错误,但大多数流程依赖于固定的多阶段工作流程,无法根据问题的难度进行调整。我们提出了Gate2Code,这是一个针对阿拉伯语表格问答的难度感知型处理流程,结合了三个组成部分:(i)基于LLM的难度路由机制;(ii)针对阿拉伯语特点的表格规范化处理;(iii)具有可控回退功能的混合编程级代码生成。简单问题可以直接解答,而需要组合推理的问题则会先经过结构化规划,再生成相应的程序。我们在一个包含615个问题的阿拉伯语表格问答基准测试中对Gate2Code进行了评估,这些数据涵盖了由LLM生成的表格、实际数据以及维基百科中的表格。在推理问题方面,DeepSeek和Mistral的零样本基线模型的宏观准确率分别为51.49%和43.95%,而Gate2Code的宏观准确率达到了95.49%和90.82%。与现有的最先进代码生成流程相比,Gate2Code不仅提高了准确率,还将推理时间减少了12–46%,令牌消耗减少了27–49%,LLM的调用次数减少了4.75–12%。这些结果表明,结合难度感知的路由机制、针对阿拉伯语的规范化处理以及结构化代码执行,可以显著缩小LLM在阿拉伯语环境中处理自由文本任务和结构化输入任务时的能力差距。
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号