一出手就表现惊艳!国产开源大模型又杀出一匹黑马

机器之心 2026-09-29 14:34
一出手就表现惊艳!国产开源大模型又杀出一匹黑马图1
机器之心发布

当 GPT-6 打出「抢着干活」的口号、Claude 把编程与终端操作牢牢按在自家腹地,开源阵营这半年也在同一条战线上加速集结 —— 从 Qwen 3.8、Kimi K3 到腾讯混元 Hy4,几乎每一次亮相都在把「代码 + 智能体」这条主线往前推一格。


一个共同的信号是:模型的价值锚点,正在从「答得漂亮」转向「干得成事」。


而在这大语言模型的红海中,一个新玩家正在悄然走入大家的视野。


我们观察到,就在昨天晚上,至知创新研究院开源了一个模型IQuest-Q1。模型采用稀疏 MoE 架构,总参数约 320B、激活参数仅约 15B,把训练重点放在代码、软件工程与复杂任务执行上,同时向推理、工具使用、长上下文理解与多步任务处理延伸。


在同代开源模型里,这是一个偏 "轻量" 的尺寸 —— 但从官方公布的评测和演示看,它给出的结果并不 “轻”。


模型权重与 Blog 已同步发布。



榜单表现:小激活参数,均衡打法演示之外,跑分是另一把尺子


一出手就表现惊艳!国产开源大模型又杀出一匹黑马图2


在涵盖代码、软件工程、终端操作、工具使用和复杂智能体任务的多项标准评测中,IQuest-Q1 整体呈现出较为均衡的表现 —— 没有靠单项极高分撑起成绩,各类任务上的能力分布相对完整。


具体到单项:



考虑到 15B 的激活规模,这份成绩单在推理成本上也留出了不小的空间。


从写游戏到修 bug,模型开始 "接活"


IQuest-Q1 主打的是「可交付」—— 模型在任务过程中持续理解上下文、调用工具、处理反馈,最终交出一个可验证的结果,而不是一段停在编辑器里的代码。


我们拿到了官方放出的几组任务演示,覆盖前端交互、3D 场景、训练调试与真实工作环境,基本能勾勒出这款模型的能力边界。


在前端场景,用户一句自然语言指令下去,模型直接吐出一个可运行的交互应用。


以 FPS 游戏为例,IQuest-Q1 一次性搞定了三维场景、角色移动、射击与换弹、生命值、计分、Boss 战,甚至连资源和装备购买都做了出来 —— 代码生成、多文件组织、交互逻辑、视觉呈现,几件事同时在跑。



再看赛车游戏这一例。赛道延展、前景与背景的切换,这类场景通常对空间连续性要求很高。IQuest-Q1 处理起来比较从容,说明它在具备空间关系和连续交互需求的应用生成上已经比较扎实。



一次强化学习训练出现异常后,模型顺着训练曲线一路查下去 —— 读日志、看执行轨迹、分析可能原因、定位到具体代码,然后动手改。修复后重启训练,再用新的指标曲线验证结果。演示里模型给出的根因让人有些哭笑不得 ——"训练轨迹中被插入了一个空格"。改掉之后,指标重新爬升。



在另一个强化学习训练诊断案例中,系统发现 Reward 异常下降并非来自模型本身,而是由运行环境故障引起。定位问题后,系统修复环境与评分逻辑,恢复有效奖励信号,避免异常反馈继续影响训练。



在真实办公场景里,模型接入了聊天、在线文档、表格与评论等一系列上下文,综合信息后完成分析、生成文档、修订结果,最后交付一份可直接 “使用” 的方案。


技术拆解:320B 总参 / 15B 激活的 MoE 架构


IQuest-Q1 采用 decoder-only Transformer 主干 + 稀疏 MoE,总参数约 320B、激活参数约 15B—— 在当下动辄 "参数越大越强" 的开源节奏里,属于把宝押在了架构效率和后训练配方上的一路。训练分三段走:


  1. 预训练:奠定基础能力和世界知识;

  2. 中期训练:向复杂任务过渡;

  3. 后训练:围绕软件工程、长时程任务和通用推理做专项训练,配合监督微调与强化学习进一步收敛能力。


团队用了 Multi-Teacher On-Policy Distillation(MOPD),把不同教师模型在各类任务上的强项合并进单一模型 —— 这也是小激活模型追赶大模型的一条常见路径。


一出手就表现惊艳!国产开源大模型又杀出一匹黑马图3


除了模型本身,团队还公开了这一版所使用的研发流程。


一出手就表现惊艳!国产开源大模型又杀出一匹黑马图4


在研发过程中,模型参与能力诊断、训练方案设计和部分实验执行;人类研究人员则负责研究方向调整、高成本实验、版本采用等关键节点的审查与决策。


经过验证的模型更新、训练资产和研究流程会进入下一轮迭代直接复用,每轮沉淀下来的数据流程、训练配置、评估方法和工具也会持续沉淀下去。


从此次实践来看,我们观察到至知研究院这个模型赛道新玩家,在代码智能、复杂任务执行和模型自进化等方向上的探索,已经开始呈现出更清晰的技术脉络,这家机构下一步的动态值得持续关注。


我们从至知抢先得到内测申请机会,感兴趣可以体验。


一出手就表现惊艳!国产开源大模型又杀出一匹黑马图5


© THE END

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
开源 大模型
more
刚刚,阶跃Step 5 Preview发布!一举杀进全球开源前三
开源王座易主?小米罗福莉发新模型:工程难度超DeepSeek-R1
10个IO口竟然能驱动90颗LED做成的耳环,还有各种灯光效果,怎么做到的?(项目开源)
小米凌晨搞大事!MiMo-V2.6开源模型发布,超越 Kimi K3、GLM-5.3,而且不涨价
南洋理工&其域创新重磅开源 | SKYTOPIA:训练用世界模型,部署扔掉预测器,单目无人机导航成功率超SOTA 15%
比Jev快2-3倍的国产开源模型来了:Intern-Decision拿下多模态决策SOTA
黄仁勋驳斥AI末日论:警惕恐慌阻碍产业落地,能源与开源成关键变量
用AI造的!刚刚,代季峰团队首个模型开源
DeepSeek开源昇腾适配组件,国产算力生态再获关键拼图
华为盘古2.0,全栈开源
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号