
点击蓝字 关注我们

欢迎各位专家学者在公众号平台报道最新研究工作,荐稿请联系小编Robert(微信ID:BrainX007); 或将稿件发送至lgl010@vip.163.com。
英文标题:SHALA-LLM : Smartly Handling Ambiguous Labels in Aligning LLMs
https://doi.org/10.48550/arXiv.2606.05376
成果简介
许多以人为中心的任务(如自然语言推理和情感识别)都存在多种合理解释,这导致了标签模糊性,也带来了标注者之间的显著分歧。随着大语言模型越来越多地应用于现实场景,准确地建模这种模糊性变得至关重要——它有助于识别存在争议的输入、保留模糊案例的多样性,并捕捉人类判断的完整分布。然而,现有的LLM对齐方法大多假设存在唯一的正确标签,在优化过程中排除了标注者的分歧。
本文提出了一种名为SHALA-LLM的新算法,不再将这种模糊性视为噪声,而是将其作为能改善模型行为的信息。该强化学习框架让LLM能够直接从标注者分布中学习,同时在优化过程中动态优先处理高度模糊的样本。在ChaosNLI、GoEmotions和MSP-Podcast等模糊敏感型NLI和ER基准上的实验表明,SHALA-LLM显著提升了对标注者标签分布的拟合程度——例如在ChaosNLI上,詹森-香农距离降低了62.1%;同时F1分数提升了16.7%,证明建模标注者分歧也能增强分类性能。
主要贡献
以标注者分歧分布替代单一标签作为监督信号:传统方法通常将多数投票结果作为唯一监督信号,而SHALA-LLM保留每位标注者的原始判断,将其汇总为经验概率分布。模型的学习目标从预测单一标签转变为拟合该分布,从而完整保留人类判断的多样性信息。
采用语言化概率输出形式:模型针对每个输入样本直接生成结构化的概率估计(以JSON格式输出各类别对应概率)。该设计使得模型能够以可解析的形式表达其对各类别的置信度,为后续奖励计算提供了标准化接口。
基于DRPO的强化学习优化框架:这里采用组相对策略优化(GRPO)作为训练 backbone。该算法无需独立训练价值网络,而是通过组内相对比较。
基于熵加权的动态奖励调制机制:该方法对每个样本的标注分布计算归一化熵值,用以量化标注者分歧程度。熵值越高的样本在训练中被赋予越高的奖励放大系数,从而使模型在优化过程中自动将更多学习资源分配给高模糊度样本,提升其在主观性强、争议性大的场景下的泛化能力。
研究方法
SHALA-LLM分为四个关键的阶段,整体架构如图1所示。

图1.SHALA-LLM整体架构。
1)数据构建阶段-从个体标注到经验分布:针对自然语言推理和情感识别等存在主观判断差异的任务,收集每位标注者的原始标签,而非简单汇总为单一多数标签。将同一输入样本所获得的多位标注者意见汇总为经验概率分布,作为模型学习的监督目标,完整保留人类判断的多样性信息。
2)模型输出阶段-语言化概率分布生成:模型针对给定输入样本,通过提示工程引导其以结构化JSON格式输出各类别的概率估计,将LLM的内部认知转化为可解析的数值分布。该设计使模型输出与人类标注分布处于同一表示空间,为后续相似度计算提供基础。
3)奖励计算阶段-分布对齐与模糊加权:对每个生成的回答,计算其预测分布与人类标注分布之间的詹森-香农距离,以此度量二者的相似程度。同时,计算该样本标注分布的归一化熵值,量化标注者之间的分歧程度。将两项结合,构成最终的SHALA奖励函数。
4)策略优化阶段-基于GRPO的动态强化学习:将前述奖励信号集成至组相对策略优化框架中。该算法在每组生成样本内部进行奖励归一化,据此计算优势值并驱动策略模型更新。高模糊样本因获得更高的奖励权重而在优化中占据更大比重,最终引导模型收敛至能够更好反映人类判断多样性的分布。
研究结果
表1. SHALA-LLM框架与基线方法在NLI和ER数据集上的性能对比。

注:括号内为相对于零样本推理(ZS)的相对变化百分比。最优结果以加粗标注,次优结果以下划线标注。
表2.SHALA-LLM框架与现有模糊感知方法在NLI和ER数据集上的性能对比。

注:最优结果以加粗标注。

图2. ChaosNLI数据集上不同模糊度水平下的性能对比。箱线图展示各方法在低、中、高模糊度样本上的表现分布。

图3.ChaosNLI数据集上不同语义类别(蕴涵、中立、矛盾)的类别层面性能分析。
表3.模型在高度模糊样本上的推理行为对比。

注:前提为“……”,假设为“……”,标签类别为蕴涵(E)、中立(N)或矛盾(C)。零样本基线给出过度自信的单一判断(矛盾概率1.0),而SHALA-LLM主动识别出多种合理解释,并输出更接近人类标注分布的概率(E: 0.20, N: 0.50, C: 0.30)。
研究结论
总的来说,SHALA-LLM通过在强化学习框架中保留标注者分歧结构并动态强化高模糊样本的权重,在自然语言推理和情感识别任务上显著提升了模型与人类判断分布的对齐精度及传统分类性能,尤其在高模糊场景下表现出优异的鲁棒性。该研究证明了将人类分歧作为信息性监督信号而非噪声的价值,为构建更贴近人类认知的大语言模型提供了新思路。
当然,该研究也存在一些有待探索的空间。SHALA-LLM目前主要在分类任务上进行了验证,对于开放式生成、长文本推理或多轮交互等更复杂的模糊场景,其效果尚待进一步检验。此外,当前方法采用经验标签分布来量化分歧,尚未深入考虑标注者专业背景、文化差异等个体因素对标注结果的影响。研究团队也指出,将该模糊感知奖励设计推广至其他强化学习和偏好优化框架,将是下一步的重要方向。尽管如此,这项研究为我们应对现实世界中普遍存在的主观性与模糊性问题提供了新的方法论视角,向着更鲁棒、更以人为本的大语言模型迈出了有意义的一步。
免责声明:原创仅代表原创编译,水平有限,仅供学术交流,如有侵权,请联系删除,文献解读如有疏漏之处,我们深表歉意。


公众号丨智能传感与脑机接口
