刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS

新智元 2026-09-14 19:19

刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS图1

  新智元报道  

刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS图2


刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS图3

大额免费Token Plan:https://discovery-home.intern-ai.org.cn/https://api.atria-asi.ai/,https://zenmux.ai/atria-asi/atria-dawn-preview

项目网站:https://atria-asi.ai/

模型权重:https://huggingface.co/internlm/Atria-Dawn-Preview

Paper链接:https://github.com/atria-asi/Atria-Dawn-Preview/blob/main/atria-dawn-preview.pdf




20 分钟,一个 MiniOS操作系统搭建了起来。


AI4AI 设计并训练一个超过 4 亿参数的天气预测模型,1 分钟,预测未来一周的全球天气。


这是智能体模型 Atria Dawn Preview 在此次展示中完成的两项任务。


上海人工智能实验室联合复旦大学、中科院软件所、中国人民大学、中科院自动化所、华东师范大学和哈尔滨工业大学等机构,共同发布了这一智能体新模型。


刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS图4


模型能做什么,自然是发布的看点。但这一次,团队还把目光转向了另一件事:这个模型,究竟是怎么被研发出来的?


在 Atria 的后训练过程中,研发人员普遍使用编程智能体辅助工作。写代码、执行实验、分析结果,AI 已经参与其中。


于是,一个问题浮了出来:当 AI 开始帮忙「造 AI」,人类还在忙什么?


越来越多的操作交给 AI 之后,AI工程团队的劳动究竟减少了多少,又有多少转移到了不容易被看见的地方?


Atria 团队收集了研发中的人机交互记录,尝试把这些分工拆开来看。



刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS图5
AI 连续执行的背后,谁在决定下一步?


回看模型研发,人类的工作一直在变。


早期,人们为模型标注数据。后来,通过偏好反馈告诉模型什么样的回答更好。如今,AI 开始参与代码编写、实验执行和结果分析。


人机协作的范围,就这样从训练数据的生产,延伸到了研发流程本身。


沿着数据、训练与评估三个环节,可以看到这一变化:


刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS图6


一些过去需要研究者一步步完成的操作,现在可以交给智能体连续推进。


但研发中,还有一类工作很难用代码行数来衡量。


问题该怎么定义?哪条技术路线值得尝试?实验结果究竟支持了什么判断?继续投入,还是及时换方向?


这些决定可能只需要几句话,却会影响后面一连串操作。


因此,想知道 AI 在研发中贡献了多少,就需要沿着过程往回看:方案是谁提出的,选择是谁作出的,卡住之后又是谁把方向纠正过来的。


这也是 Atria 团队分析交互记录的出发点。



刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS图7
769 条任务记录,拆开 AI 研发背后的人类劳动


团队分析了 56 名参与者的 769 条任务记录,并结合智能体日志,观察研发中的人机分工。


其中,739 项任务明确回答了是否使用 AI,713 项涉及 AI,使用率达到 96.5%


在这批被调查的研发工作里,用 AI 已经相当普遍。


不过,96.5% 回答的是「有没有用」,还没有回答「承担了多少」,更没有回答「谁在作决定」。


真正值得展开的,是接下来几组数字。


刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS图8

约三分之一的已完成任务,参与者认为「没有 AI 就做不成」


刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS图9

在 455 项已完成、使用了 AI,且获得有效可行性回答的任务中,151 项被参与者判断为:如果没有 AI,自己负责的部分就无法完成。


占比 33.2%


这里有一个明确前提:任务范围、质量要求和其他资源保持不变。


也就是说,对这些参与者而言,AI 的作用已经延伸到任务是否可行。一部分原本受资源或个人能力限制的工作,有了 AI,才进入了能够完成的范围。


当然,这里的「做不成」,来自参与者对当时情况的回顾性判断。

这些任务可能确实超出了参与者在给定条件下、不借助 AI 所能完成的范围,也可能是 AI 的使用改变了他们对自身能力和任务可行性的判断。

参与者认为任务离不开 AI,并不意味着最终选择也由 AI 作出。要理解 AI 在工作中的作用,还需要进一步区分:谁提出方案,谁作出最终选择。

刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS图10

AI 经常出方案,多数最终选择仍由人作出


刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS图11

再看技术决策。


在执行岗位参与者报告的 567 项方法或参数决策中,AI 提出方案的比例达到 64.6%


其中,最常见的协作方式是:AI 提出,人类选择。


这一组合占全部此类决策的 55.4%


如果把视线放到最终选择上,分工就更加清楚:85.5% 的方法或路线决策由人类作出最终选择,AI 作出最终选择的比例为 9.2%


在目标或范围、验收标准两个环节,人类作出最终选择的比例,也分别达到 93.4% 和 81.9%


甚至在那 151 项被参与者认为「没有 AI 就无法完成」的任务中,仍有 144 项由人类最终选择目标,占比 95.4%


两件事同时发生了。研究者依赖 AI 完成工作,AI 也经常参与技术方案的形成;与此同时,人类仍然承担着多数最终选择。


哪些方案值得采用,哪些结果符合要求,研究应该朝哪个方向推进,这些判断构成了人类工作的重要部分。


把整个任务简单标成「人做的」或「AI 做的」,很容易把中间的分工混淆。方案提出、最终选择和具体执行,需要分别看。


刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS图12

遇到困难,76.0% 经人类帮助继续推进,只有 0.7% 由人类接管


刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS图13


智能体卡住之后,会发生什么?


团队请参与者回顾了每项任务中最关键的一次困难。在记录了困难及应对方式的 588 项任务中,76.0% 经人类介入后继续推进,由人类接管主要工作的比例只有 0.7%


人类最常做的两件事,分别是:


另有 23.0% 的任务由 AI 自行恢复推进。


这让「人类介入」有了更具体的样子:研究者补上缺失的信息,判断问题出在哪里,或者调整方法,智能体随后继续执行。


修改产出时,也出现了类似的分工。


在明确记录主要 AI 产出去向的 627 项任务中,354 项发生了实质性修改,占比 56.5%


而在这些需要实质性修改的任务中,75.4% 由 AI 根据人类反馈完成修改


初稿是 AI 写的,修改稿也可能是 AI 写的。


但两版之间,人类指出了什么问题、提出了什么要求,同样影响着最终结果。


如果只统计生成内容、代码量或直接编辑次数,这部分通过反馈完成的工作,就很容易被低估。



刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS图14
8 项基准,两项第一、两项第二


研发过程之外,Atria Dawn Preview 本身的能力,也是此次发布的重点。


团队对模型进行了评测,并与其他基线模型展开对比。具体结果如下:


刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS图15


在团队给出的 8 项基准对比中,Atria Dawn Preview 取得了 两项第一、两项第二

这组结果展现了它有竞争力的智能体能力。


分数之外,团队还给出了三个 Demo,分别对应模型训练、软件开发和网络安全。它们把模型组织工作、使用工具、根据反馈继续推进的过程,放到了具体任务里。


刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS图16

禁用网络搜索,训练一个超过 4 亿参数的天气模型


第一个任务,直接让 AI 参与全球天气预测模型的设计与训练。


任务提供了 超过 100 GB 的全球气象数据,同时禁用了网络搜索。Atria Dawn Preview 需要基于这些数据,构建能够学习气象变量变化规律的预测模型。


在这一过程中,它设计了一个 参数量超过 4 亿的 ViT 骨干网络,完成 45,000 步训练,学习 69 个气象变量随时间的演化规律。


最终,系统能够在 1 分钟内,预测未来一周的全球天气


在该案例的评测设置下,系统使用了更少的训练数据,部分预测指标优于英伟达的经典天气预报模型 FourCastNet


而任务最终交付的,是一个经过训练、能够运行的天气预测系统。模型设计之后,训练和运行也实际完成了。



刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS图17

20 分钟,从自然语言需求到 MiniOS


第二个任务,转向软件开发。


Atria Dawn Preview 从自然语言需求出发,在 20 分钟内构建了一个 MiniOS,把文字描述转化为可运行的软件成果。


这一案例关注的是完整项目如何推进:组织开发工作、实现代码,并最终交付一个能够运行的系统。


自然语言需求进入任务流程,可运行的软件成为最终产出。



刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS图18

进入隔离靶场,把漏洞发现、修复和环境恢复接起来


第三个任务发生在隔离靶场中。


Atria Dawn Preview 从网站分析和攻击面排查开始,进一步完成漏洞发现、利用、与修复。


过程中,模型不仅要识别网站结构和潜在风险,还要通过多轮测试排除错误判断、定位真实漏洞,并完成攻击、修复和复验。


这项任务覆盖了从发现潜在漏洞,到验证漏洞是否成立,再到修复漏洞的过程。



三个案例,让基准分数之外的执行过程变得更具体:模型如何安排工作,如何利用工具反馈,以及如何把任务推进到最终结果。



刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS图19
AI 帮忙造 AI,下一轮还能继续吗?


把模型能力与研发过程放在一起看,Atria 的这次实践提供了两个观察角度。


一边,是后训练得到的模型能够完成哪些任务。


另一边,是完成这次后训练,人和 AI 各自承担了什么。


如果 AI 的能力继续提升,这两条线就会进一步交汇,触及 递归自我改进


AI 参与模型研发,推动能力提升;提升后的能力,再投入下一轮研发,带来进一步改进。


但要让这个过程持续运转,还有问题需要回答。团队将注意力放在了其中两点。


刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS图20

AI 做得更快,检验能不能跟上?


当 AI 能够更快地修改训练流程、构建工具和开展实验,研究者会得到更多结果,也需要及时判断哪些结果值得相信。


训练信号可靠吗?评估漏掉了什么?自我修改有没有偏离原来的目标?


这些问题,都需要有相应的检验。


一轮实验中没有被发现的错误,可能被带进下一轮,继续影响后续判断。


因此,研发自动化向前推进时,独立评估、可追溯的过程记录,以及异常情况下的暂停和回退机制,也需要跟上。


实验数量和执行速度可以增加,改进是否可靠,仍然要经过验证。


刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS图21

下一次,能不能由 AI 主动请人帮忙?


人类什么时候介入,是这次观察的一部分。


再往前一步,AI 能否自己判断:什么时候需要人类参与?


目标不够明确,证据彼此冲突,或者问题必须依赖现实世界的反馈,这些时候,继续执行未必能解决问题。


模型需要识别:哪些事情可以自行处理,哪些需要补充信息、专业判断或明确授权。


这也可能改变人的工作方式。研究者可以在关键节点提供判断和帮助,而不必持续指挥每一步操作。


但有效的求助,需要模型把问题说清楚。


卡在哪里,有哪些不确定性,为什么需要人类参与,得到的反馈又该如何用于后续行动,这些都是能力的一部分。


从 AI 辅助研发走向递归自我改进,还有多远,需要在一轮轮实践中检验。


Atria Dawn Preview 展示了模型能够把任务推进到什么程度。Atria 的研发记录,则让人看见了这些成果背后的协作过程。



刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS图22
96 人,65 名在校生,这支团队的另一面


Atria 背后,是一支学生广泛参与的年轻研发团队。


按学生与 AI Lab 正式员工统计,96 名主要成员中,有 65 名在校生,占比超过三分之二


其中,博士生 33 人,本科及硕士生 32 人,与 31 名正式员工共同参与项目研发。专项组长中的学生比例达到 70%


团队汇聚了上海人工智能实验室、复旦大学、中科院软件所、中国人民大学、中科院自动化所、华东师范大学和哈尔滨工业大学等机构与高校的研究力量。


不同高校、不同培养阶段的青年学生,在同一个大模型后训练项目中开展协作,也共同参与了这次关于 AI 能力与人机分工的实践。


而 Atria 这个名字,也藏着团队对这项工作的理解。


Atria 是南三角座的主星,和此前 Delta、长江三角洲与三角形的意象天然呼应;atrium 原意是中庭、汇聚空间,像一个让不同学校、团队与学科在这里相遇、协作的场所。


一颗星,指向更远的探索;一个中庭,容纳不同的人与想法。Atria 也许正代表着这样一种可能:让更多人一起,把智能体能力推向下一步。


刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS图23
刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS图24
刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS图25


参考资料:

https://github.com/atria-asi/Atria-Dawn-Preview/blob/main/atria-dawn-preview.pdf

编辑:大卫


秒追ASI
点赞、转发、在看一键三连
点亮星标,锁定新智元极速推送!

刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS图26
刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS图27
刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS图28

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI
more
AI开始改进“改进自己的方法”,RSI进入平方时代丨MetaRSI
第四届AI安防与视觉技术创新发展论坛顺利开展,聚焦感知升级与产业新机遇
当AI幻觉开始操作电脑:深大、港科大提出ECA,让Agent行动前先验证证据
端侧AI从「能跑」到「会进化」,元空智能跑进惠普预装
一年连融三轮,这家金融AI公司又拿下超3亿B轮
AI 3D很热,但真正的付费市场还没想象中那么大 | AI 100
小米卢伟冰定调家电新十年:从“听话”到“主动”,AI重塑交互逻辑
NI Days 2026:AI半导体与智能系统、6G通信与商业航天两大分论坛议程率先揭晓
腾讯研究院AI速递 20260915
看完国内首场 AI 艺人线下演唱会,我开始期待「她」返场
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号