CodeLite:一种通过增强型代码表示与词汇融合实现代码分类任务的低成本框架

《ACM Transactions on Software Engineering and Methodology》:CodeLite: A Low-Cost Framework for Code Classification Tasks via Enhanced Code Representations and Lexical Fusion

【字体: 大 中 小 】 时间:2026年08月16日 来源:ACM Transactions on Software Engineering and Methodology 6.9

编辑推荐:

  摘要AI总结要查看此AI生成的总结,您需要拥有高级访问权限。了解更多登录摘要摘要在软件工程中,用于代码分类任务的常见方法是依赖大规模代码语言模型,如StarCoder和CodeLlama。尽管这些模型表现优异,但它们需要大量的计算资源,这不仅会增加能源消耗,还会限制其在资源有限环

  

摘要

摘要

在软件工程中,用于代码分类任务的常见方法是依赖大规模代码语言模型,如StarCoder和CodeLlama。尽管这些模型表现优异,但它们需要大量的计算资源,这不仅会增加能源消耗,还会限制其在资源有限环境中的应用。在这项工作中,我们提出了“CodeLite”这一相对轻量级的框架,它将规模适中的代码模型,如CodeBERT,与传统的基于频率的技术相结合,从而在性能和计算效率方面优于更大的模型。我们的方法包含多个阶段,首先是对基于编码器的代码模型进行优化,利用其中间层信息来捕捉超出默认[CLS]标记的更丰富的词汇和句法特征。同时,我们还采用了针对源代码优化的、经过正则表达式强化的TF-IDF组件,以捕捉互补的基于频率的模式。随后,这些表示通过合适的融合技术与学习到的代码嵌入相结合,用于最终决策。在包括编程语言识别、作者归属判定以及AI抄袭检测在内的多项下游任务中,CodeLite的表现始终优于强大的基线模型,其绝对准确率相比其他方法提升了4.2%,而相比去掉某些组件的版本则提升了11.8%,同时训练成本也显著降低。我们还进行了多项统计测试和消融研究,以验证所提框架中各组件的作用。总体而言,我们的结果表明,将轻量级模型与针对任务特点的特征增强相结合,可以为各种软件工程任务提供一种实用且高效的替代方案,无需使用重量级的语言模型。

AI总结

AI生成的总结(实验性)

此总结是由自动化工具生成的,未经文章作者撰写或审核。它旨在帮助读者发现相关内容、评估文章相关性,以及帮助来自相关研究领域的读者理解本文内容。它是对作者提供的摘要的补充,后者仍是文章的主要总结。完整文章才是权威版本。点击此处了解更多。

点击此处,可以对此总结的准确性、清晰度及实用性发表意见。您的反馈将有助于进一步优化和生成后续版本。

要查看此AI生成的通俗语言总结,您需要拥有高级访问权限。

相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号