大语言模型表格数据合成器的配置敏感性:小模型记忆效应与报告协议

《IEEE Access》:Configuration Sensitivity of LLM Tabular Data Synthesizers: A Small-Model Memorization Effect and a Reporting Protocol

【字体: 时间:2026年09月09日 来源:IEEE Access 4.2

编辑推荐:

   摘要:问题。大型语言模型(LLMs)通过将每一行序列化为文本来合成表格数据,这迫使模型做出与任务无关的表现形式选择——行序列化、列顺序和数字格式——而理想的生成器应忽略这些选择。我们询问在单一固定配置下比较 LLM 表格合成器是否安全。方法。我们逐一扰动这三个维度,针对一个

  

摘要:

问题。大型语言模型(LLMs)通过将每一行序列化为文本来合成表格数据,这迫使模型做出与任务无关的表现形式选择——行序列化、列顺序和数字格式——而理想的生成器应忽略这些选择。我们询问在单一固定配置下比较 LLM 表格合成器是否安全。方法。我们逐一扰动这三个维度,针对一个微调生成器(GReaT)和一个少样本上下文(ICL)生成器进行测试,并以两个文本盲生成器(CTGAN、TVAE)作为配置不变的噪声基线。两个部分互为补充:一个三数据集广度部分(7B 上下文模型;成人、糖尿病、学生)测试泛化能力,另一个 15 个种子的糖尿病案例研究隔离了机制。结果。(1)配置在每个数据集上都颠倒了生成器排名(66–95% 的配置对),并且增加两个强大的近期基线会增加不稳定性,而不是消除它。(2)该效应是生成器特定的:带有生成器×配置交互的 ANOVA 显示配置主效应较小(6.7%),且颠倒的排名处于统计上近乎持平的生成器之间——因此不稳定性部分是近乎等价的结果,而非巨大的格式效应。(3)上下文敏感性很大程度上是逐字记忆的人为现象——0.5B 模型复制了其 42.9% 的行,而在固定样本量下移除副本会消除其保真度优势——随着模型规模增大而减弱(7B 时平均为 0.5–13.5%),但随模式宽度增加而增加(33 列时高达 74.4%)。与独立的、无记忆污染参考相比,平均三种配置可以消除单一配置的差异(高达 29%)。贡献。我们发布了两个零构造诊断指标(逐字复制率和配置扩散指数)、一个经过验证的报告协议以及所有代码和数据。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号