万级回合专业比赛数据,让AI化身你的专属“网球教练”

量子位 2026-08-20 15:55
TennisVAR 团队 投稿 
量子位 | 公众号 QbitAI

现在的多模态大模型已经可以看视频、识别动作,甚至生成一段颇有专业感的比赛点评。

但真正的问题是:它是真的看懂了,还是只是很会“说”?

以网球比赛为例,面对赛事,当模型说“球员通过主动进攻赢下这一分”时,它能不能进一步指出:到底是哪几拍建立了优势?哪一拍改变了攻防态势?

面对网球爱好者,模型能不能告诉用户为什么总在这里丢分,又该从哪里开始改?

这恰恰是当前体育多模态大模型最难补上的能力缺口之一:从“看见动作,真正走向“理解规则与复盘决策”。

最近,来自厦门大学、上海创智学院、上海交通大学的研究团队提出TennisVAR,希望补上的正是这一块能力:让AI在网球比赛中不只是看见一次击球,而是能够沿着一连串击球,还原背后的战术逻辑,并把支撑判断的具体击球证据找出来。

万级回合专业比赛数据,让AI化身你的专属“网球教练”图1

围绕现有问题,研究团队还提出了一个体育赛事领域的视频理解新任务——基于击球证据的战术推理(stroke-evidence-grounded tactical reasoning),并且提出了一套大型网球赛事推理Benchmark——TRACE(Tactical Reasoning with Action-Chain Evidence in Tennis),通过TennisVAR的事件解析和图战术推理等,让AI进化到“真的懂球”。

万级回合专业比赛数据,让AI化身你的专属“网球教练”图2

迈向真正的AI体育,需要有针对体育项目设计的全新多模态范式

多模态大模型在体育赛事的应用上,perception到understanding,存在一条“感知到理解”的鸿沟:传统方法可以精确检测击球事件,却往往把每一拍独立处理;视频语言模型可以给出听起来很合理的高级分析,却不一定能指出支撑这个结论的具体击球。

举个例子,面对一个多拍相持的场景:为什么球员的截击没能终结这一分?模型不仅要能回答发生了什么“因为对手连续两次用反手穿越化解了进攻”,还得进一步知道:前面哪几拍在铺垫?用的是什么战术?最终的战术结论到底是从哪里来的?

这就是研究团队提出的新的网球视频理解任务,基于击球证据的战术推理(stroke-evidence-grounded tactical reasoning)。它想解决的,本质上是一个更难的问题:过去,AI更擅长判断一个回合中发生了什么,或生成一段“听起来合理”的赛后分析;而TennisVAR希望再往前一步——不仅识别每一拍打了什么,还要理解为什么这样打,以及前后多拍如何共同构成一套战术。

从“看见动作”,到“还原战术逻辑”,这才是让AI真正开始“懂球”的关键一步。

光答对还不够,这次AI考试开始要求“写过程”了

研究团队重新给AI出了一套网球考题。为了测试模型究竟有没有“看懂”,团队没有只问最终答案。而是一口气要求模型输出五样东西:

开放式回答+分层战术标签+支撑结论的击球序列+决定性的关键击球+推理解释。

更狠的是,每一个作为“证据”的击球,还必须定位到球拍与球实际接触的画面帧。

这就像一道数学题:以前只看最终答案对不对,在开放文本的任务中也就是回答的像不像。

现在不仅要答案,还得把中间步骤写出来,而且老师可以逐行检查。

为此,研究团队构建了新的大规模数据集TRACE。包含11189个回合视频、41485次击球事件、25429个战术单元和11189组问答。数据来自109场职业比赛、72名球员,覆盖大满贯、巡回赛、奥运会和团体赛事。

他们不是简单给一段比赛贴上“进攻”“防守”标签,而是把一分球内部每一次击球,以及这些击球如何共同构成战术都标了出来。

万级回合专业比赛数据,让AI化身你的专属“网球教练”图3

更有意思的是,他们没有把“战术”简单做成一个扁平分类表。TRACE设计了三级战术体系,分别包含6、17、25个类别,覆盖发球、接发、底线组织、上网转换、防守反击等模式。

问题难度也被划成三级。

于是,AI面对的不再是一帧一帧的视频,而是一整段连续决策。

万级回合专业比赛数据,让AI化身你的专属“网球教练”图4

最关键的一步:别让大模型直接“看视频瞎猜”

TennisVAR整个方法里,最值得注意的其实是一个思路:先把视频重新组织成“事件”,再让大模型推理。

整套架构可以概括成四个词:Event→Relation→Evidence→Tactic

事件、关系、证据、战术。

首先是Event Parsing Module,EPM事件解析模块。

网球和一般视频不太一样。球小、速度快,一次真正关键的球拍触球甚至只是很短的一瞬间。所以团队没有单纯把一堆视频帧塞进视觉大模型,而是同时融合三类线索:DINOv3负责画面和球员等视觉语义;短时运动特征负责捕捉突然的动作变化;TrackNet负责提供网球的运动轨迹。

随后模型将连续视频转化为一个个明确的击球事件。

谁打的、什么技术、往哪个方向、结果是什么,以及最关键的——触球发生在哪一帧。

这相当于先把一场高速发生的比赛翻译成AI更容易处理的“战术语言”。

但有事件还不够。真正的战术,本来就是多拍之间的关系。

于是第二个核心模块来了:Tactical Graph-Guided Temporal Reasoner,TGTR战术图引导时序推理模块。

研究团队直接把每一次击球变成图上的一个节点。然后建立两种关系:

比如:A打了一拍。B回球。A又打下一拍。虽然A的两次击球中间夹着B,但从战术决策上看,这两拍恰恰可能属于同一个连续计划。TennisVAR因此会额外把它们连接起来。这样一来,模型看到的不再只是:A-B-A-B-A。而是能够继续追踪:A自己连续几次做了什么选择。

这才开始有了“复盘战术”的味道。

万级回合专业比赛数据,让AI化身你的专属“网球教练”图5

GPT等最新的通用大模型能输出“像样”的回答,但是“证据”却差了一大截

研究团队通过最新的通用多模态模型来测试,包括Llama-4、DeepSeek-VL2、Qwen系列,以及Gemini、Claude和GPT-5.5等闭源模型,同时还设置了InternVL3-8B、Qwen2.5-VL-7B、Qwen3-VL-8B经过TRACE监督微调后的版本。

结果很有意思。通用大模型在ROUGE、BLEU等文本相似度指标上并不难看,但在击球证据定位上表现直接崩了。GPT-5.5零样本情况下:T-F1@8:37.03 T-IoU@4:24.54,TennisVAR则分别做到:73.04和56.19。

而即使跟已经用TRACE数据监督微调过的模型相比,TennisVAR依然拉开了差距。相较各指标最强的SFT基线,它在T-F1@8上提升19.94个百分点,T-IoU@4提升33.03个百分点,分层战术F1提升6.08个百分点。

越到复杂问题,这套结构化方法的优势仍然存在。在最难的Q3“决策推理”任务中,TennisVAR的T-F1@8达到54.88,最强基线为40.17;T-IoU@4则达到37.64,最强基线17.43。

通用大模型已经可以生成“听起来挺合理”的答案,但如果进一步要求它指出:到底是哪几拍支撑了这个结论?关键证据在哪里?战术是什么?战术又是如何一步步形成的?模型从“感知到理解”的鸿沟就迅速显现出来了。

这其实印证了当前多模型大模型在细分领域应用的一个老问题:

大模型话说得像,不一定代表视频真的看懂了。

万级回合专业比赛数据,让AI化身你的专属“网球教练”图6
万级回合专业比赛数据,让AI化身你的专属“网球教练”图7

把模块拆掉,AI马上又“看不懂球”了

消融实验也很说明问题。去掉TGTR之后:整体得分直接下降9.07个百分点,T-F1@8下降17.14个百分点,关键击球识别准确率下降10.92个百分点。

而如果保留图推理,却拿掉针对问题筛选证据的Evidence Router,分层战术F1又会下降10.18个百分点。也就是说,让模型变强的并不只是“给它看更多网球视频”。而是把击球事件、事件关系、问题相关证据明确建模出来。

这也是这篇工作真正有意思的地方。

万级回合专业比赛数据,让AI化身你的专属“网球教练”图8

体育多模态大模型,终于要从“解说”走向“复盘”

TennisVAR是一个针对网球领域的挑战提出来的模型。但这篇论文提出的问题,其实远不止网球。对于体育视频来说,“看到了什么”只是第一层。真正高价值的信息往往是:WHY?为什么会这样?一脚传球为什么能撕开防线?一次挡拆为什么逼出了错位?赛车手前几个弯的线路选择,为什么决定了后面的超车机会?

这些问题都存在一个共同特点:结论发生在最后,但原因分散在此前的一连串动作中。

而TennisVAR做的,就是要求AI大模型把这条推理链真正“交出来”:发生了哪些击球事件,它们之间存在怎样的关系,哪些事件构成回答问题的关键证据,哪一步最具决定性,以及最终如何由这些证据形成战术判断。

当AI大模型开始真的能理解懂球了:

TennisVAR展示了另一种可能:下一代体育AI真正有价值的地方,也许不是比人更会喊“好球”,而是像一个坐在场边的教练一样,在比赛结束之后把视频重新打开,然后告诉你:

“看这里。其实这一分,从这一拍开始就已经不一样了。”

现在,大模型不光能告诉你这一分是谁赢了。

它开始试着解释——这一分,究竟是从哪一拍开始赢的。

论文标题:TennisVAR: A Stroke-Evidence-Grounded Multimodal Large Language Model for Tactical Reasoning in Tennis Videos
作者信息:Yifan Mei、Qingling Shi、Changli Wu、Jiayuan Rao、Jiayi Ji、Liujuan Cao

论文地址:https://arxiv.org/abs/2608.12920
项目主页:https://whynotgit2025.github.io/TennisVAR/
项目代码:https://github.com/WhynotGit2025/TennisVAR

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —


【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁从哪来投稿内容附上项目/主页链接,以及联系方式

🎓 我们会 (尽量) 及时回复你 :)


🌟 点亮星标 🌟

科技前沿进展每日见

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI
more
AI for Science开始“动手”了:机器人正式走进国家级实验室
拆透具身智能100万小时:真能喂出一个“聪明”机器人吗?|AI100闭门会
米家正式进军欧洲,宇树科技上市首日股价收涨460%,我国首个针对AI客服的国标将发布,三星或上调芯片代工价格,这就是今天的其他大新闻!
AI造世界,难在第二步
Calendly入局AI会议笔记赛道,推出“Callie”助理并强化隐私合规
来恩智浦创新技术峰会(上海),体验边缘AI驱动软件定义汽车、机器人与工业创新!
阿里发布AI音乐模型“快乐虾米”,昔日平台以技术形态“复活”
快手Q2财报:可灵AI营收暴增两倍,DAU创历史新高
NVIDIA 与本地 AI 社区共同推动开源模型和智能体发展
亚马逊Prime Air版图激增至500城,安全隐忧下的“空中快递”加速跑
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号