面向希腊新闻编辑室的开源检索增强生成(RAG)聊天机器人:KriKri与Multilingual-E5-large-instruct驱动的本地化可溯源新闻辅助系统

《SoftwareX》:Leveraging open-source technologies for a retrieval-augmented generation chatbot in Greek newsrooms

【字体: 大 中 小 】 时间:2026年10月10日 来源:SoftwareX 1.9

编辑推荐:

  本文提出一种面向希腊新闻编辑室的检索增强生成(Retrieval-Augmented Generation, RAG)聊天机器人应用。该系统利用开源希腊语大语言模型(Large Language Model, LLM)KriKri以及开源嵌入模型(embedd

本文提出一种面向希腊新闻编辑室的检索增强生成(Retrieval-Augmented Generation, RAG)聊天机器人应用。该系统利用开源希腊语大语言模型(Large Language Model, LLM)KriKri以及开源嵌入模型(embedding models),通过使人工智能(Artificial Intelligence, AI)的使用不依赖外部提供商,强调新闻编辑室自主性。该聊天机器人旨在通过提供基于事实的答案并附有来自信誉良好的希腊新闻媒体的引用来源,辅助记者开展调查。该应用可在本地运行,从而为新闻编辑室提供一种可访问且保护隐私的AI解决方案。数据集由来自四个不同希腊新闻网站的文章组成。研究人员描述了系统架构,包括用于来源检索的向量数据库构建、指令微调模型(instruction-tuned model)的集成,以及显示链接来源的聊天机器人界面的实现。针对高年级新闻学学生的初步评估显示,感知有用性、易用性、满意度以及采用该工具的意愿均为积极,凸显了独立、本地化、透明且可信的AI解决方案对新闻业的重要性。
在虚假信息广泛传播的媒体环境中,现代新闻编辑室将信息准确性与可验证性置于优先位置。数字媒体和在线新闻消费增长,使新闻编辑室需要仅从经过验证来源检索信息,而非不加区分地从互联网检索,以保护公众免受宣传和仇恨言论等操纵内容影响。大语言模型(Large Language Model, LLM;大规模文本训练的语言模型)作为自然语言处理(Natural Language Processing, NLP;处理人类语言的AI技术)模型,在翻译、摘要、问答、情感分析和文本分类等任务表现较强,但新闻业还要求最新信息、事实基础、来源可追溯和可验证生成主张。通用LLM依赖训练知识,可能产生过时、缺乏支持或难追溯回答。检索增强生成(Retrieval-Augmented Generation, RAG;先检索证据再生成答案的方法)可基于检索文档生成回答,确保可验证性和可追溯性。希腊语NLP资源与应用有限,希腊语聊天机器人资源较少。相关研究涉及GraphRAG、结合RAG与零样本学习、上下文学习(In-Context Learning, ICL)和ReAct代理的自动新闻生成、新闻编辑室LLM架构、ScoreRAG、教育RAG、本地LLM检索框架、Open-RAG,以及希腊语境下ChatGPT协作分析、AI采用和事实核查。研究人员提出面向希腊新闻编辑室的开源RAG聊天机器人,使用希腊语指令微调LLM Llama-KriKri-8B-Instruct和多语言嵌入模型,提供事实答案与引用,支持本地部署,维护编辑独立、隐私与数据保护。研究人员构建模块化架构,从 kathimerini.gr、efsyn.gr、skai.gr、zougla.gr 四个希腊新闻网站获取约73 K篇文章及元数据,存入向量数据库(vector database;存储文本向量并支持相似性检索的数据库),通过Streamlit界面提问,经嵌入和语义搜索检索文档,结合会话历史与结构化提示输入指令微调LLM,生成有来源依据回答;支持元数据过滤(metadata filtering;按作者、来源、栏目、日期筛选)、可展开来源引用和查询扩展(query expansion;利用摘要增强查询)。定位不是自主文章生成,而是辅助记者研究。意义在于支持可验证、本地化、透明和可信AI新闻辅助。

关键技术方法概括(不超过250字):数据用Beautiful Soup(BS4)和Selenium抓取,来源为上述四个希腊新闻网站约73 K篇文章;采用Multilingual-E5-large-instruct多语言嵌入模型,文本分块500 tokens、20%重叠,存入Chroma并支持增量更新;采用Llama-KriKri-8B-Instruct希腊语指令微调LLM,上下文窗口最多128 K tokens并支持链式思维(Chain-of-Thought, CoT);应用为Streamlit,两阶段检索:先检索最相关文章生成五词摘要扩展原查询,再二次检索,并加入作者、网站、栏目、日期过滤;温度0.1,最多生成1024个新tokens;评估样本为30名高年级新闻学学生,在受控实验室环境中使用。

研究结果按小标题概括:Motivation and significance指出虚假信息、通用LLM时效与来源追溯不足、希腊语资源有限,构成动因;RAG更适合新闻业,全开源本地部署保护独立性、隐私与数据保护。Related work总结GraphRAG在复杂查询中可捕捉关联信息;RAG、零样本、ICL和ReAct代理支持实时检索与新闻生成;模块化新闻室架构整合RAG、语义搜索和API;ScoreRAG提升事实一致性;教育RAG展示通用性;本地LLM五阶段管道强调透明度、编辑控制、数据安全、可审计性和来源验证;Open-RAG增强开源LLM检索推理。与既往多关注英语、专有/云系统、通用检索或自动新闻生产不同,本研究使用希腊LLM、多语言嵌入、完全开源本地部署,聚焦证据型新闻辅助。Software description介绍软件架构和功能。Software architecture描述数据获取预处理、分块、嵌入、向量数据库、Streamlit协调、元数据过滤、两阶段检索与查询扩展、结构化提示生成。Software functionalities的Dataset and vector database creation通过BS4和Selenium抓取约73 K篇文章,日期转Unix时间戳,保存URL、标题、作者、网站、日期、栏目和索引;每篇分块500 tokens、20%重叠,块标识为“URL:Row_ID:Current_Chunk_Index”,存入Chroma并批量插入。Application methodology使用Streamlit,嵌入模型Multilingual-E5-large-instruct,为文档和查询定义不同前缀,tokenizer最大长度512 tokens,嵌入归一化;缓存tokenizer、Llama-Krikri-8B-Instruct、向量库和过滤元数据;UI支持作者、网站、栏目、日期过滤和1至20来源文档滑块;查询扩展比较四种策略,依据精度、回答质量、响应时间和来源正确性选择最相关文档五词摘要扩展策略;系统提示要求模型作为新闻助手,客观、仅基于来源、避免个人意见、分析但简洁;回答后去除重复URL并以可展开元素显示。Illustrative examples通过代表性用例展示希腊语查询、元数据过滤、两阶段检索、来源依据回答和引用检查。Impact指出系统支持可验证、基于本地档案的问答,应对事实准确性、透明度、来源可追溯和独立性;开源本地部署可整合入工作流并保持编辑控制;查询扩展、元数据过滤和指令微调生成提升相关性。30名高年级新闻学学生在受控实验室评估,低和中复杂度事实检索与信息综合问题在相关性、准确性、清晰度和无偏性上得分积极,高复杂度逻辑推理比较问题表现下降;用户中心评估显示感知有用性8.2、搜索有效性8.2、答案满意度8.2、易用性8.6、采用意愿8.2,净推荐值(Net Promoter Score, NPS)为50。Conclusions and future work认为系统结合检索、查询扩展、元数据过滤和指令微调生成,可基于本地新闻来源产生相关且透明回答,初步评估积极,高复杂度推理仍需改进。

讨论部分总结:讨论强调该系统拓宽AI在新闻业中的使用,支持以本地新闻档案为依据的可验证问答,解决事实准确性、透明度、来源可追溯以及独立于封闭或外部控制AI系统等编辑挑战;开源架构和本地部署为希腊记者提供可整合入新闻编辑室工作流并保持编辑控制的实用工具;系统通过检索相关文档并生成符合新闻需求的回答改善档案信息获取,对记者、研究RAG、虚假信息缓解和AI辅助媒体生产的研究人员也有用。未来工作将扩展数据集,增加更多样和均衡的新闻来源,加入更多评估指标,在更广领域测试;通过更复杂查询扩展和确保相关段落来自多个新闻媒体改善检索质量;优化答案生成和对话历史处理以提升计算效率;与替代开源和专有LLM比较,评估性能、可访问性、隐私和本地部署取舍;可能支持用户上传文档、多用户部署以及面向个体兴趣和工作流的基于代理的记者画像;该方法在具备合适知识库并正确调优检索和生成组件时可适配其他领域。

研究结论翻译:本文介绍了一种基于检索增强生成(RAG)的聊天机器人系统,旨在通过可验证的、以档案为依据的问答支持希腊记者。该系统结合检索、查询扩展、元数据过滤和指令微调生成,以基于本地新闻来源产生相关且透明的回答。其开源和可本地部署的设计支持编辑独立性、透明度以及对新闻编辑室需求的适应性。在当前媒体环境中,此类工具尤为重要,因为虚假信息可能削弱公众信任。通过将答案建立在可追溯来源上并保持对知识库的控制,该系统为负责任的AI辅助新闻业提供了一个实用且适应性强的框架。初步用户评估进一步显示,感知有用性、易用性、满意度和采用潜力均为积极,同时也表明高复杂度推理问题仍是重要改进方向。

订阅生物通快讯

订阅快讯:

最新文章

限时促销

会展信息

关注订阅号/掌握最新资讯

今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

版权所有 生物通

Copyright© eBiotrade.com, All Rights Reserved

联系信箱:

粤ICP备09063491号