大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26

量子位 2026-09-09 12:30
vivo AI Lab团队 投稿 
量子位 | 公众号 QbitAI

自动手语翻译中,一直存在一个隐蔽难题:模型即使已经较好地对齐了视觉与文本,也可能在逐词生成时,被某个局部合理、却缺少视觉证据支持的词带偏。

这样造成的偏差,又会成为后续生成的上下文,最终累积成整句语义偏移。

vivo AI Lab研究团队把问题进一步追到强化学习的“更新规则”上,并提出CAPO-SLT(Confidence-Aware Policy Optimization for Sign Language Translation),在不更换视觉编码器与奖励函数的前提下,让强化学习阶段的手语翻译生成更稳、更忠实。

从沟通无障碍到数字包容:手语翻译为什么重要?

手语不是把口语逐字换成手势,而是拥有自身语法、空间表达与非手部信息的视觉语言。自动手语翻译要把连续的视频或姿态序列转换为自然语言,让手语使用者与不懂手语的人能够跨越语言模态直接交流。它连接的不只是两种表达方式,也是现实世界与数字服务之间的一道接口。

在公共服务、医疗沟通、教育课堂、应急信息、客户服务、职场协作和在线视频等场景中,专业手语翻译资源并不总能随时覆盖。可靠的自动翻译技术可以补充人工服务,为信息获取、内容生产与双向沟通提供更及时的支持,并推动无障碍能力从少数专门场景走向日常产品。

社会价值对应着更高的可靠性要求:“流畅却译错”往往比明显的不通顺更难察觉。一个关键词、否定关系或事件主体的偏移,就可能改变整句话的含义。因此,手语翻译不仅要追求指标提升,更要忠实于视觉证据并保持生成稳定。

大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26图1
同样是正优势词元,统一裁剪无法区分其置信度;CAPO按旧策略置信度分配不同的更新上限。

手语翻译模型“看懂”之后,为什么还会“说错”?

自动手语翻译同时面对模态差异、时间粒度差异和语言结构差异:手部动作可能非常细微,相近手势容易混淆,动作边界并不总是清楚,表情、口型等非手部线索也可能不完整。近年来,研究重点多放在视觉—语言对齐上,让模型先学会把动作与文字放进同一个语义空间。

但“对齐得好”并不等于“生成得稳”。翻译是自回归过程:模型生成一个词,再把它连同此前内容用于预测下一个词。强语言先验会让某些续写听起来很自然;一旦它们没有得到视觉证据充分支撑,流畅反而可能掩盖错误。

强化学习本可直接根据整句质量优化模型,却又引入新的噪声:奖励通常在句子层面给出,优势值却要分配到每个生成词上。模型知道“这一整句总体更好或更差”,但未必能准确判断究竟是哪个词做对了、哪个词造成了偏移。

症结:所有词共用同一把“限速器”

PPO、GRPO等策略优化方法会限制新旧策略的概率比,避免单次更新迈得太大。传统上限是固定的:所有“正优势”词元共享同一个裁剪范围。这个规则简单有效,却忽略了词元之间截然不同的状态。

旧策略已经高度确信的词,可能只是语言先验下的“顺口选择”,继续大幅放大其概率容易强化错误路径;旧策略概率较低、但获得正优势的词,可能正是值得纠正和探索的方向,却被同一上限压住了更新空间。

CAPO并不把“高置信度”当成“语义正确”的证明。旧策略概率只被当作控制更新幅度的信号,用来回答:这个词已经被旧模型偏好到什么程度,还需要多大的增幅?

解决思路:让每个词拥有不同的更新上限

对于正优势词元,CAPO根据旧策略为该词分配的概率动态设置上裁剪边界。旧策略置信度越高,上限越接近保守范围;置信度越低,则保留更大的正向更新空间。论文将基础上限设为0.2、最大放宽到0.3

这并不是压制高置信度词。高置信度且获得正优势的词依旧会被强化,只是不被不必要地过度放大。对于负优势词元,CAPO进一步为损失幅度设置上限,降低句级奖励噪声把个别词“罚得过重”的风险。

大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26图2
先建立跨模态表征与翻译能力,再用CAPO约束强化学习阶段的词元级更新。

从姿态到句子:模型是怎样训练出来的?

中文侧使用CSL-News进行大规模预训练,再在CSL-Daily上监督微调、强化学习与评测;英文侧使用YouTube-ASL预训练,并在How2Sign上验证美国手语翻译。论文还在WLASL2000上进行孤立词识别评估。

结果:仅用姿态输入,中文手语三项指标均取得表中最佳

大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26图3

在CSL-Daily测试集上,与此前同样只使用Pose输入的Geo-Sign相比,三项指标分别提升2.93、1.260.64分;与Pose-only的Uni-Sign相比,则分别提升4.96、3.073.67分。论文对比表还包含同时使用Pose与RGB的方法,而CAPO-SLT在仅用姿态的情况下仍拿到三项最高值

大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26图4
CSL-Daily主结果。CAPO-SLT仅使用Pose输入;红色为表中最佳结果,蓝色为第二名。

跨语言与辅助任务

在How2Sign上,CAPO-SLT仅使用Pose,取得41.4BLEU-1、15.2BLEU-4和34.9ROUGE-L;相较同样使用Pose的Uni-Sign,分别提升1.0、0.70.6分。在WLASL2000上,Per-Instance与Per-Class准确率分别为63.77%61.91%,说明姿态表征在另一类手语理解任务上仍保持竞争力。

消融实验:增益来自哪里?

研究团队让SFT、GRPO、DAPO和CAPO共用同一监督检查点、同一奖励与训练设置,只替换策略优化规则。相较DAPO,CAPO的三项指标分别提升0.30、0.500.67分。移除负优势上限后,结果降至58.48/28.03/57.80;把反比例置信度映射换成相同范围的线性映射,BLEU-4与ROUGE-L分别下降0.730.60分。

“听起来对”与“意思真的对”,差别就在几个关键词

没有CAPO时,模型会把“我分别介绍这几位同事”翻译成“我是一个由几个人组成的团队”;把“天黑了,我害怕”译成“天黑了,我睡着了”;还会把“这部电影的女演员很漂亮”改写成“这部电影讲的是女演员的爱情故事”。这些句子都算流畅,却替换了谓词、实体关系或事件含义。

加入CAPO后,这三组译文均恢复到与参考答案一致或语义等价的表达。剩余错误主要是局部遗漏、时间表达偏差或轻微措辞差异,而不是整句意义彻底翻转。

大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26图5
绿色为正确表达,红色为错误或缺乏视觉支持的内容。

训练曲线也给出同一方向的证据

GRPO的平均熵先快速下降,随后在训练后期重新上升,反映策略不确定性再次增加;CAPO则在早期下降后逐渐稳定,没有出现突然的熵坍塌,也没有后期明显反弹。置信度感知裁剪让词元级更新更受控,与方法希望改善的“生成阶段稳定性”一致。

大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26图6
GRPO(上)与CAPO(下)的策略熵和KL散度。CAPO的熵在早期下降后趋于稳定。

从“对齐”走向“稳定生成”

CAPO-SLT的价值不在于再叠加一个更大的视觉编码器,而在于把关注点从“模型有没有看懂动作”延伸到“模型怎样把理解稳定地说出来”。当奖励来自整句、更新却发生在每个词时,给所有词相同的更新上限未必合理;旧策略置信度提供了一个无需额外模型、可直接计算的控制信号。

这种设计也具有工程上的可移植性:CAPO不修改视觉主干和奖励函数,只替换策略优化中的裁剪规则。对于已经具备监督初始化和PPO/GRPO式强化学习流程的手语翻译系统,它提供了一条相对低侵入的稳定化路径。

局限与下一步

CAPO在美国手语翻译上的增益比CSL-Daily更温和。当前奖励完全依赖参考译文,将BLEU、ROUGE-L等重叠指标与BERTScore结合,仍难完整覆盖合理改写、篇章级充分性和细粒度语义偏好。未来,团队计划探索学习式偏好模型或面向手语翻译的专用语义评估器。

论文标题:《CAPO-SLT: Confidence-Aware Policy Optimization for Stable Sign Language Translation Generation》
作者:Ling Zhou、Yuhao Chen、Lin Cheng、Chengwen Yao、Donghui Sun、Xiaoxin Chen。Ling Zhou 与 Yuhao Chen 为共同一作,Donghui Sun为通讯作者。
论文链接:https://openreview.net/pdf?id=l4bCsrSkYx

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —


【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁从哪来投稿内容附上项目/主页链接,以及联系方式

🎓 我们会 (尽量) 及时回复你 :)


🌟 点亮星标 🌟

科技前沿进展每日见

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
NLP 大模型
more
手机本地一键成片,靠的是一个8B小模型的自我进化 | EMNLP'26
小米8篇论文入选EMNLP 2026,聚焦端侧AI落地与算力优化
多模态检索头首次被锁定:揭开大模型长文档内部检索真相 | EMNLP'26
2025年中国自然语言处理(NLP)行业现状及发展趋势分析,技术创新是推动其持续发展的关键动力「图」
EMNLP 2025 | CARE:无需外部工具,让大模型原生检索增强推理实现上下文高保真
LLM真能读懂报表吗?EMNLP'25首个工业级表格生成报告基准T2R-bench:最强大模型仅得62分
港科广×腾讯联手打造《我的世界》神操作,400张截图就能让AI挖矿通关,成本降至5%|EMNLP 2025
刚刚,NLP先驱、斯坦福教授Manning学术休假,加盟风投公司任合伙人
可攻可防,越狱成功率近90%!六大主流模型全中招 | EMNLP'25
告别一次性全盘推理,这套skill让每条证据都能追溯预测结果 | EMNLP'26
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号