

这项由南加州大学(University of Southern California)研究团队完成的研究,发表于2026年的COLM(Conference on Language Modeling)会议,论文编号为arXiv:2607.17524,有兴趣深入了解的读者可以通过该编号查询完整论文。
大模型"说谎"是个多大的问题?
你有没有用过ChatGPT或者类似的AI助手,让它帮你查个资料,结果它一本正经地给出了一个看起来很专业、实际上完全错误的答案?这种现象在学术界有个专门的名字,叫做"幻觉"(hallucination)——AI不是故意欺骗你,而是它在没有把握的情况下,仍然会流畅地"编造"出听起来合理的内容。
这个问题在文本摘要和机器翻译领域尤其棘手。当你让AI把一篇长文章压缩成摘要时,它可能会悄悄把"11月7日"改成"10月7日",把"波兰华沙"改成"斯洛伐克华沙"。每个词看起来都差不多,但信息已经悄悄出错了。南加州大学的研究团队意识到,现有的训练方法在解决这个问题时存在根本性的局限,于是他们提出了一个全新的思路:与其教AI生成正确的词,不如教AI辨别哪些词是错的。
这个听起来像绕弯子的思路,却带来了在多个测试场景中的显著改进,这便是本文要介绍的核心工作——TOPL(Token-Level Off-Policy Labeling,逐词离线标注法)。
一、AI说错话,根子到底在哪里
要理解这项研究的意义,先得明白现在的AI是怎么被"教导"的。
现代大型语言模型(LLM)在训练好之后,还需要经历一个"后训练"阶段,目的是让它更听话、更准确、更符合人类需求。这个阶段常见的训练方法大致分两类。一类叫"在线方法",比如GRPO,它要求AI在训练过程中不断自己生成新的答案,然后对这些答案打分再改进。好处是效果不错,坏处是需要大量计算资源,训练过程非常繁琐。另一类叫"离线方法",比如大名鼎鼎的DPO(直接偏好优化),它提前收集好"哪个答案好、哪个答案差"的数据,再用这些数据训练模型,省去了在线采样的麻烦。
但无论是哪种方法,它们都有一个共同的问题:监督信号太粗糙,只在整篇回答的层面上评判好坏,而不关注是哪个具体的词出了问题。这就好比一位老师批改学生的作文,只写"整体一般",却不指出哪个句子写错了、哪个地方用词不当——学生很难从这种反馈中学到具体该怎么改进。
更棘手的是,这些方法训练出来的模型在面对训练数据以外的新场景时,表现往往会大幅下滑——这在机器学习领域叫做"分布外泛化"问题,可以理解为:学生在学校死记硬背了一套题目,换了一套新题就不会做了,因为他没有真正理解背后的规律。
南加州大学的团队想解决的,正是这个"换题就蒙圈"的问题。
二、给每个词贴上"合格"或"不合格"的标签
TOPL的核心思路,可以用一个质检工人的比喻来理解。
普通的AI训练方法,像是工厂里的质检员拿到一整批产品,只检查这批货"整体合不合格"——合格就收下,不合格就退回。而TOPL做的事情,是让质检员逐个检查每一个零件:这颗螺丝没问题,那块钢板有裂缝,这个接口有毛刺……通过这种逐件排查,工厂能更清楚地知道哪道工序出了问题,从而有针对性地改进。
具体来说,TOPL的训练流程分为三步。
第一步是准备带有"问题标记"的训练数据。研究团队使用了一个叫FAVA的数据集,这个数据集的特别之处在于它不只包含正确的摘要,还包含被人为篡改过的"错误版本"——比如把正确日期换成错误日期、把真实地点换成虚构地点等。每一处篡改都被精确标注出来,精确到哪个词是"坏词"、哪个词是"好词"。这样,每个词都有了一个标签:1代表"正确、可信",0代表"被篡改、不可信"。
第二步是改变AI学习的目标。传统训练让AI去预测"下一个词应该是什么",而TOPL把这个目标换成了"判断当前这个词是不是可信的"。也就是说,AI不再被要求生成文字,而是被要求对每个词做出一个二元判断:好词还是坏词。这个判断通过一个轻量级的"评分头"来完成,它接受AI处理完文字后产生的内部状态,输出一个0到1之间的概率分数。
第三步是把学到的能力"迁移"回生成文字。TOPL训练完成后,那个用来判断好坏的"评分头"会被移除,但AI在训练过程中通过LoRA(低秩适应,一种高效的参数微调技术)学到的内部调整会被保留并合并到原始模型中。这样,模型在实际生成文字时,依然使用原来的方式工作,但它的内部"直觉"已经被悄悄优化过了——它更能感知哪些词汇的生成可能带来事实错误。
这里需要稍微解释一下LoRA是什么。可以把一个大型AI模型想象成一座巨大的图书馆,里面有几十亿本"书"(参数)。如果要改变图书馆的风格,最笨的办法是把所有书都重新印一遍。LoRA的做法是只在每个书架旁边放一个小夹层,用少量的新内容来调整整体方向,而不用动原来的书。这样既省空间又省时间,效果还相当不错。
三、在哪些层"动手术"最关键
这项研究还有一个细节值得关注:TOPL并不是对AI的所有层都进行训练,而是需要选择在哪些层插入LoRA。
一个大型语言模型就像一栋多层楼房,每一层都在处理不同层次的信息。底层负责处理最基础的文字特征,中间层负责理解语义和逻辑关系,顶层负责最终决定输出什么词。研究团队做了一个系统的滑动窗口实验,像扫描CT一样逐段测试:如果只在前三层装LoRA会怎样?在中间六层呢?在最后十二层呢?
实验结果显示出一个清晰的规律:中间层是效果最好的"手术位置",结合早期层则效果更佳。如果把LoRA插到最后几层,效果反而会变差,有时甚至不如不训练。
为什么顶层反而不好?研究团队给出的解释是:模型的顶层与"把想法转化成具体词汇"这个任务高度绑定,如果用一个分类任务(区分好词坏词)来干扰这里,就会破坏模型原本学到的生成能力,就像把一位经验丰富的厨师的切菜习惯强行改掉,可能反而让他做菜更慢更差。
四、"好坏都要有"才能学好
研究团队还做了一组很有意思的实验,专门测试训练数据的标签结构对效果的影响。
他们构造了多种不同的训练配置。"原始"配置就是正常的训练数据,好词占67%,坏词占33%。"随机"配置是把标签随机打乱,让模型学不到任何真实规律。"均衡"配置是把好词和坏词各占一半。"偏坏"和"偏好"配置是故意让某一类占多数。"纯好词"配置是只保留正确的词进行训练。"密集均衡"配置是在保持好坏各半的同时,增加更多训练数据。
结果揭示了一个关键原则:模型需要同时见过好词和坏词,才能真正学会区分。单纯给它看好词("纯好词"配置),效果明显不如既有好词又有坏词("密集均衡"配置),即便后者的训练数据总量更少。这就像教一个孩子辨别真钱和假钱,如果只给他看真钱,他永远也学不会辨别,必须两种都见过,才能建立真正的判别能力。
另外,好坏比例在一定范围内并不是决定性因素——偏好、偏坏还是均衡,差异并不大。真正重要的是"两者都有"这个条件本身。
还有一个有趣的发现:当给Qwen3-8B模型喂入随机标签时,它仍然能比基础模型表现得好一些,这说明这个模型本身对"乱训练"有很强的抗干扰能力;而Llama和Gemma在随机标签下则明显退步,表现出对训练信号质量更高的依赖。
五、实验结果说明了什么
研究团队在11个不同来源的文本摘要数据集上,对TOPL和多种竞争方法进行了系统比较。这些数据集都来自AggreFact这个评测基准,每个数据集的风格、领域和难度都有所不同,用来测试模型"换了新场景能不能稳定发挥"的能力。
所有方法生成的摘要,都用一个叫Bespoke-MiniCheck-7B的评估模型来打分,分数在0到1之间,越高代表事实准确性越好。评估时,每个摘要会被拆解成一句一句,每句单独评分,最后取平均值。
TOPL在使用Qwen3-8B和Gemma-3-4B两个基础模型时,都获得了所有方法中最高的平均分;在Llama-3.1-8B上,与最强基线方法(Unlikelihood训练)非常接近。综合三个模型、11个数据集的表现,TOPL达到了最佳的整体平均成绩。
值得关注的对比是TOPL和SOPL(序列级离线标注法)之间的差距。SOPL是研究团队专门设计的一个"对照实验"——它和TOPL的逻辑完全相同,唯一的区别是把监督信号从"逐词标注"改成了"整句标注"。结果显示,SOPL的效果远不如TOPL,这直接证明了逐词级别的精细监督信号,是TOPL表现出色的核心原因,而不仅仅是"离线训练"这个大框架本身。
研究团队还特别分析了生成摘要的长度,以排除"模型偷懒生成更短、更保守的摘要来规避错误"这种可能性。分析表明,TOPL生成的摘要长度和其他方法差异不大,甚至有时比基础模型还要长一些,说明性能提升是真实的事实准确性提升,而非投机取巧。
六、从文字摘要到语言翻译,能力能否复制
为了验证TOPL不只是一个"文字摘要专用工具",研究团队还把它应用在了机器翻译任务上。
这次他们使用的是MLQE-PE数据集,包含四种语言对:英语-德语、英语-中文、罗马尼亚语-英语、爱沙尼亚语-英语。这个数据集有一个特别适合TOPL的特点:它的标注是逐词级别的翻译质量评分,可以直接转换为TOPL所需的好词/坏词标签。
训练完成后,模型在MLQE-PE的测试集(同分布场景)和FLORES-Plus(不同分布、真实应用场景)上分别进行了评估,使用的评估指标是XCOMET,一个能感知细粒度翻译错误的自动评分系统。
结果和文字摘要任务高度一致:TOPL在分布外场景(FLORES-Plus)上超越了所有对比方法,包括SFT、TLDR和Unlikelihood训练。这说明TOPL学到的不是某个特定任务的表面规律,而是更具普遍性的"辨别准确与不准确内容"的内在能力。
七、AI内部发生了什么:LoRA像一个智能阀门
TOPL不只带来了好的实验数字,研究团队还对"为什么有效"进行了深入的机制分析,这部分内容相当有启发性。
他们借助一个叫"条件引导"的理论框架来解释TOPL的工作原理。这个框架的核心思想是:可以通过在AI的内部状态上添加特定方向的"推力",来改变模型的输出倾向。
LoRA由两个矩阵组成,通常叫A矩阵和B矩阵。研究团队发现,在TOPL训练后,这两个矩阵扮演了截然不同的角色。A矩阵扮演的是"侦测器"的角色——它能将AI的内部表示投影到一个低维空间中,而在这个空间里,"可信词"和"不可信词"会自然地分布在不同区域,形成清晰可分离的两个群落。B矩阵扮演的是"方向盘"的角色——根据A矩阵侦测到的信号,B矩阵会把内部状态向"更可信"的方向推,或者向"更不可信"的方向拉,取决于当前词的特征。
这两个矩阵合在一起,就像一个精密的自动阀门:先感知当前状态(A矩阵做侦测),再决定往哪个方向调整(B矩阵做引导)。整个过程发生在AI生成每个词的瞬间,无需人工干预。
为了验证这个假设,研究团队设计了两个实验。第一个实验是测量A矩阵的"分类能力"——把AI在处理文字时产生的内部向量投影到A矩阵的子空间中,看看好词和坏词能否被清晰区分,用AUROC(一种分类准确性的衡量指标,越接近1代表区分能力越强)来量化。结果显示,TOPL的A矩阵AUROC高达0.754,而SFT、DPO、SOPL的A矩阵AUROC都只在0.60到0.63左右——TOPL明显更善于利用A矩阵来感知词汇的可信程度。
第二个实验是测试B矩阵的"引导效果"——训练完成后,人工调节B矩阵对内部状态的影响强度(用一个系数λ来控制),观察模型的事实准确性如何随之变化。结果非常直观:对于TOPL,λ从负值变到正值的过程中,准确性先升高后降低,呈现出一个清晰的钟形曲线,说明B矩阵确实在朝着"更可信"的方向引导模型。而SFT对同样的操作几乎没有反应,说明SFT训练出的B矩阵并没有形成这样有意义的方向结构。
研究团队还观察到:A矩阵的分类能力和模型的分布外泛化性能之间存在正相关——A矩阵分得越清楚,模型在新场景下的表现就越稳定。这提示A矩阵的分离程度可能是判断一个训练方法泛化潜力的有效参考指标,尽管研究团队谨慎地指出这还不是确定的因果关系。
八、研究的局限与未来的方向
任何研究都不是终点,研究团队在论文中坦诚地列出了几个值得继续探索的方向。
首先,训练数据的质量对TOPL的效果有直接影响。FAVA数据集中的"坏词"是人为制造的,和真实AI生成时产生的错误可能有所不同。如果能用更接近真实AI幻觉的数据来训练,效果或许会更好。
其次,TOPL目前主要在摘要和翻译这两类任务上得到验证。研究团队认为它有潜力迁移到推理任务中——比如数学解题、逻辑推断——因为这些任务同样需要精确识别哪个推理步骤出了错,但这还需要进一步的实验验证。
再者,通过改变训练标签,TOPL未来或许可以被用来对模型的行为进行更精细的控制,不只限于"事实准确性"这一个维度,但目前这还停留在理论层面。
最后,A矩阵的分类能力与泛化性能之间的相关性是一个有趣的发现,但它们之间是否存在真正的因果关系,目前还不清楚。搞清楚这一点,有助于更深入地理解大型语言模型在不同训练范式下的内部工作机制。
说到底,TOPL这项工作的核心贡献在于提供了一个不同寻常的视角:与其让AI学会"怎么说对",不如让它学会"什么是说错了"。这种看似迂回的路径,反而让模型在真实应用中更加稳健可靠。就像一个经过大量错误案例训练的质检员,比一个只见过完美产品的新手,更能在流水线上快速发现问题一样。
这项研究发表于2026年COLM会议,对于关注AI可靠性和大模型后训练方法的读者,arXiv:2607.17524这个编号可以帮助你找到完整的技术细节。
Q&A
Q1:TOPL和普通的SFT训练方法有什么本质区别?
A:SFT(监督微调)是让模型预测"下一个词应该是什么",相当于告诉模型"正确答案是这个词"。TOPL则完全不让模型预测词汇,而是让它判断"这个词是不是可信的",本质上是一个二分类任务。训练完成后,TOPL通过保留LoRA更新来改变模型内部的表示结构,让模型在正常生成文字时"内置"了更强的事实准确性意识,而不是通过记忆训练数据的分布来生成文字。
Q2:LoRA rank设置为4是不是太小了,会不会影响效果?
A:研究团队在实验中统一使用了rank=4、α=8的LoRA配置,这是一个相当小的秩。从实验结果来看,即使如此低秩的配置,TOPL依然取得了比其他方法更好的分布外泛化性能。这在一定程度上说明TOPL学到的是高度压缩的、方向性很强的内部调整,而不是依赖大量参数来记住训练数据的细节。研究并未对不同rank做消融实验,这是一个值得进一步探索的问题。
Q3:TOPL在训练时需要多少计算资源?
A:从论文附录的训练超参数来看,TOPL在单张RTX A6000显卡上训练,批次大小为16,不需要梯度累积,而对比方法如SFT、DPO等通常需要4张显卡、更小的批次加梯度累积才能完成训练。这说明TOPL的计算开销相对较低,是一个在资源效率上也有优势的方法。
通弘网提示:文章来自网络,不代表本站观点。