生成式AI
一、Grok 4.6发布,跑分追平GPT-5.6不涨价
1.马斯克发布旗舰模型Grok 4.6,Artificial Analysis综合智能指数达61分,追平GPT-5.6 Sol,仅落后Fable 5一分,进入第一梯队;
2.在GDPVal、AA-Briefcase、Harvey LAB等基准反超Fable 5,法律场景以22%对14.2%领先,但DeepSWE、Terminal-Bench等复杂软件工程任务仍有差距;
3.升级不加价,API维持2美元/6美元,单任务平均成本0.84美元约为对手三分之一,并预告Grok 4.7将于3至4周内发布。
二、Ilya旗下SSI首个模型曝光,主打测试时训练
1.X网友爆料Ilya旗下SSI正探索基于TTT(测试时训练)的小型推理引擎,模型通过专门数据学习"如何学习",在解题过程中更新部分权重,小规模也能与大模型抗衡;
2.爆料称当前版本已就绪,团队正将下一代规模扩展10倍,最快8月向少数用户开放,与英伟达50亿美元投资及算力提升一个数量级的合作相呼应;
3.TTT让模型在推理时用眼前数据继续训练自己、直接改变参数,区别于外部脚手架方案,但也面临学偏、遗忘等安全挑战,消息真实性尚未证实。
三、DeepSeek上线V4 Pro正式版,强Agent能力
1.DeepSeek突然发布V4 Pro正式版,命名为DeepSeek-V4-Pro-0813,API文档率先更新,官方暂未调升使用价格;
2.跑分图显示V4 Pro在Agent相关评测表现优异,几乎可与Claude Fable 5等顶级模型媲美,用户反馈其思维链风格已出现变化;
3.此次上新恰与马斯克Grok 4.6撞车,此前V4 Flash因用户激增导致API多次性能下降、算力不足酝酿涨价,V4 Pro能否兼顾性价比受关注。
四、阿里首度开源2.4万亿参数旗舰模型Qwen3.8
1.阿里首次开源Max级旗舰模型,开放Qwen3.8-2.4T-A95B权重,总参数2.4万亿、每Token激活950亿,原生支持26万Token上下文并可扩展至101万,主打长周期自主智能体任务;
2.基准测试中PaperBench取93.0分、OSWorld-Verified 86.1分居首、CAD基准91.5分均超Fable 5,但TerminalBench、SWE-bench Pro等仍落后于GPT-5.6 Sol与Fable 5;
3.Unsloth AI用1-bit量化将模型从4.9TB压缩至397GB、缩减91%,国内API每百万Token输入12元、输出36元,与Grok 4.6、DeepSeek V4 Pro同夜发布。
五、混元推出WorldClaw,一句话生成可编辑3D世界
1.腾讯混元3D团队推出开放世界生成框架WorldClaw,用户输入一句文本即可生成可自由探索、可继续编辑的大规模3D世界,采用由粗到细的Agentic生成方式;
2.生成分意图分析与场景规划、全局地形生成、区域对象生成、场景精修四阶段,多Agent协作并借助SAM3、Blender等工具自动检查修正尺度、悬浮、穿模等问题;
3.生成的建筑、车辆、植被等均为可单独编辑复用的独立3D资产,展示了海盗岛屿、沙漠战场等案例,推动3D生成从"模型生成资产"走向"Agent编程构建世界"。
六、小红书开源dots.tts,连续自回归语音合成基座
1.小红书dots团队与上海交大X-LANCE实验室开源dots.tts,20亿参数全连续端到端自回归TTS基座,跳过离散Token量化,直接在连续隐空间逐块建模并还原波形;
2.在Seed-TTS-Eval三个子集上平均内容准确度与说话人相似度达SOTA,支持流式输出,1T1A双流模式音频首包低至54.4毫秒,SGLang单卡最高16路并行;
3.采用Apache 2.0开放六个检查点及训练、推理、微调、蒸馏全套代码,并推出支持文本、情绪、韵律、停顿四类编辑的dots.tts.edit,构成可持续扩展的语音合成基座。
七、腾讯WorkBuddy升级资料库,AI原生文档共创
1.腾讯WorkBuddy发布5.3.11版本,将资料库升级为AI原生知识管理空间,除Word、Excel、PPT外新增支持HTML、Markdown等格式,人与AI可共同读写协同编辑;
2.HTML支持人机双写,改HTML如改Word般简单,可人工改、AI改、多人协作改,改完可一键发布为公开网页链接,Markdown支持批注、框选修改与逐条审阅;
3.推出"轻应用"能力,一句话即可搭建会存数据的网站,HTML中加入CSV数据表即可实现页面与在线表格双向同步,CSV还支持存储文件。
前沿科技
八、谷歌Pixel 11系列上手,硬件半代升级却普遍涨价
1.谷歌在发布会前解禁Pixel 11系列上手,含标准版、Pro、Pro XL和Pro Fold四款,全系升级256GB起步,基础款899美元、Pro与Pro XL分别1099和1299美元、Fold达1899美元,平均涨价约100美元;
2.被媒体评为半代升级,新功能HiLight呼吸灯仅显示Gemini对话状态和来电提示且为Pro专属,基础款换4800万像素主摄、Pro系列用上2400尼特Super Actua屏,Fold折痕未改善;
3.Gemini Intelligence获较正面评价,Rambler语音、动态Gemini窗口、Magic Cue主动建议全系上线,但类智能体能力提升有限,Pixel被指已沦为Gemini的物理容器。
报告观点
九、谷歌DeepMind发Nature,四维度Agent治理框架
1.谷歌DeepMind团队在Nature发表观点文章,提出Agentic Profile框架,从自主性、效能、目标复杂度和泛化四个维度系统刻画AI Agent核心属性,超越"是否为Agent"的二元分类;
2.以AlphaGo、ChatGPT-3.5、Claude 3.5 Sonnet(含工具调用)及Waymo为案例绘制画像,指出工具接入会实质改变Agent治理属性,相同模型能力在不同部署环境下风险水平可能完全不同;
3.核心洞见是"更强的Agent不一定需要更多治理",关键在于能力类型对应的治理方式,为技术审计、权限管理、责任分配和监管分级提供共同语言。
👇加入AGI数据库,AI智能问答

👇订阅下方合集,获取每日推送