告别「小道消息」与研发黑盒!上海AI实验室探索「全开放预训练」开源模式

机器之心 2026-07-29 13:41
告别「小道消息」与研发黑盒!上海AI实验室探索「全开放预训练」开源模式图1
机器之心发布

这一次,上海人工智能实验室(以下简称:上海 AI 实验室)不仅开源模型参数,更将大模型研发的「黑盒」打开。全量 Checkpoints、训练日志、内部架构采纳与取舍全过程实验全面公开。基模架构探索平台 ArchSpace 正式亮相,开启大模型开源全新阶段!当前,「下一个概念预测」模型(NCP)、深度注意力模型(Depth-Attention)等十余种架构创新提案正在开放验证。


告别「小道消息」:为什么我们需要一场开源范式革命?


过去几年,大模型架构快速演进,新方法层出不穷。但哪些尝试真正有效,哪些最终被放弃,又是基于什么作出取舍,外界往往无从得知。对于 LLM 架构创新的工作来说,如果说有比一个新想法更重要的,那可能会是公开、完整的验证过程,以及对成功和失败经验的如实记录。


在大语言模型(LLM)狂飙突进的今天,另一个不容忽视的现实是:最前沿的研发进展,正日益集中于掌握巨量计算资源的科技巨头手中。


科技巨头的研发节奏极快,而传统学术界从实验、论文撰写到投稿、审稿、发表的漫长周期,在以天为单位的产业迭代面前显得捉襟见肘。


由此出现了一个颇为尴尬的现象:AI 领域最前沿的技术细节与研发经验,越来越多地依靠私下交流、业内传闻乃至「小道消息」传播。无论学术界还是工业界,都缺乏一个公开、规范、记录可靠,并能让实验结果完整回溯的公共创新平台。


尤其在基础模型架构创新中,这一问题尤为突出。每一代开源基模发布,往往带来新的架构设计,但这些设计背后的探索过程 —— 哪些方案经过验证,哪些尝试最终失败,又为何做出取舍 —— 很少被完整公开。一项看似有效的创新,适用于多大规模的模型,经过完整训练流程后能否保持效果,带来的是实际收益还是额外成本,常常缺少公开、可验证的实验结果作为支撑。


大模型研发,不应是一个只展示结果、隐藏过程的「黑箱」。为此,上海 AI 实验室书生团队宣布将采用一种新的开发与开源模式:不仅开放最终的模型参数,也将逐步公开预训练过程中的实验记录、架构取舍和验证结果,推动大模型预训练从「结果开源」走向「过程开放」。


告别「小道消息」与研发黑盒!上海AI实验室探索「全开放预训练」开源模式图2

ArchSpace 架构创新开放验证可视化官网



不仅开源最终参数,更开源研发生命线!


放眼国内外的大模型开源实践,所谓「开源」大多仍止于结果层面:发布最终模型权重,或提供一份技术报告,至于研发过程中的试错经验、架构权衡与失败实验,外界通常难以了解。


书生团队认为:真正的开放,不仅是共享「终点」,更是共享探索的每一个脚印。


在书生团队看来,开源不应只交付最终结果,也应尽可能公开结果产生的过程。上海 AI 实验室表示,此次将逐步开放大模型研发与训练的各个环节,具体包括:



ArchSpace 平台上线:直观可视化架构演进


为了将这种「全开放」模式落到实处,上海人工智能实验室将重点聚焦于基础模型架构(Foundation Model Architecture)的创新,涵盖但不限于:



同时,正式推出配套的开源可视化平台 ArchSpace。


在 ArchSpace 上,上海 AI 实验室将以一个经典的 Decoder-only Transformer 为起点,全面可视化从该起点出发的所有后续单点架构创新及迭代过程。


以一个新的 Attention 方案为例,用户可以在网站上清晰看到:



每一个创新点,都有据可查;每一次成功或失败,都完全可回溯。


告别「小道消息」与研发黑盒!上海AI实验室探索「全开放预训练」开源模式图3

ArchSpace 架构提案与实现流程:从社区提交 issue、审阅与投票,到分支实现、阶段性实验和合并。


具体而言,社区若关心近期架构创新论文提出的「下一个概念预测」(Next Concept Prediction,NCP)等方向的真实效果,可在 ArchSpace 的 GitHub 仓库提交相应的 架构创新提案(architecture proposal issue)。


提案经委员会审阅通过后,ArchSpace 将分阶段推进 scaling 与验证工作,依次在 1B、3B 和 8B 等主流模型尺寸上进行效果评估。目前最大规模的验证将对齐全开源基模 Olmo 3 的完整训练流程:覆盖预训练、长上下文继续训练和指令遵循微调,训练规模合计约 6.2T tokens。模型训练、评测日志将在 Weights & Biases(W&B)平台记录并公开,最终将架构创新的知识、经验透明开放给行业共享。


委员会由学术界与工业界的专家联合组成,目前仍在持续建设,现有成员包括上海交通大学林洲汉副教授、复旦大学张奇教授、复旦大学纪焘助理教授、上海 AI 实验室青年研究员团队等。


评委会将以同行评议方式,对社区提交的架构创新提案进行审阅,重点从创新价值、技术可行性与实验设计完备性三大纬度,遴选出具备验证价值的提案进入 ArchSpace 正式验证流程。对于通过评议的提案,实验室提供双聘、实习生等多样化合作机会。


告别「小道消息」与研发黑盒!上海AI实验室探索「全开放预训练」开源模式图4

ArchSpace 架构验证流程:与 Olmo 3 训练流程对齐,覆盖 1B、3B、8B 模型规模。


告别「小道消息」与研发黑盒!上海AI实验室探索「全开放预训练」开源模式图5

ArchSpace 训练、评测日志可视化


目前,ArchSpace 已汇聚 Next Concept Prediction [1]、Depth-Attention [2]、SiameseNorm [3]、Artificial Hippocampus Networks [4]、MorphNorm [5] 、Mobius [6] 等十余项架构创新提案。这些提案正在等待「跑完全程」,接受同一套公开、完整的训练与评测验证。


据上海 AI 实验室介绍,ArchSpace 委员会当前仍保持开放,并邀请学术界和产业界更多专家加入,共同发现并推动真正值得验证的架构创新。


上述架构创新相关的论文或提案:



资源有限,但探索无限:大模型时代科研组织的新范式


依托现有算力条件,上海 AI 实验室将率先在 1B/3B/8B 参数量级上,对这一全新的开发与开源模式进行实证与落地。


尽管当前规模尚属轻量级,但这标志着实验室正积极探索并构建一种适配大模型时代的全新科研组织范式:



这不仅是上海 AI 实验室书生团队在基模架构创新上的一次深度试炼,更是献给全球 AI 科研社区的一份礼物,期待共同见证开源大模型的全新阶段。


© THE END

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI 开源
more
Anthropic CEO公开信引争议:开源立场与监管主张再掀波澜
携程被罚没 51.79 亿元,SpaceX 星舰第 13 飞成功,OpenAI 突发服务器故障,OpenAI 加入 AI 开源组织,这就是今天的其他大新闻!
Kimi K3正式开源/长鑫上市首日市值一度超越腾讯/英伟达成立开放AI安全联盟,OpenAI缺席
曝梁文锋不满会议实录外泄,或暂缓融资/黄仁勋发文力挺开源模型,OpenAI加入/Claude Code删掉80%系统提示词|Hunt Good 周报
特斯拉开源Model S/X设计软件,停产旗舰迎“数字永生”
为什么美国做不出顶尖开源模型?
梅赛德斯-奔驰把汽车开发板开源了!STM32G4+扩展板+Zephyr,全套PCB 3D模型!
长鑫科技批量造富:12名核心成员身家过亿,碧桂园却卖飞痛失490亿;哈啰电车骑行中断电落锁致博士十级伤残;月之暗面开源Kimi K3模型
月之暗面正式开源Kimi K3模型;长鑫科技首日收盘市值3.28万亿元稳居A股一哥;小米澎程官宣7月30日发布;尊界时代旗舰MPV定档8月5日...
昨夜今晨全球大公司动态 | 《财富》最新世界500强亚马逊登顶;英伟达牵头成立网络安全联盟捍卫开源AI
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号