腾讯研究院AI速递 20260814

腾讯研究院 2026-08-14 00:08

生成式AI

一、Grok 4.6发布,跑分追平GPT-5.6不涨价

1.马斯克发布旗舰模型Grok 4.6,Artificial Analysis综合智能指数达61分,追平GPT-5.6 Sol,仅落后Fable 5一分,进入第一梯队;

2.在GDPVal、AA-Briefcase、Harvey LAB等基准反超Fable 5,法律场景以22%对14.2%领先,但DeepSWE、Terminal-Bench等复杂软件工程任务仍有差距;

3.升级不加价,API维持2美元/6美元,单任务平均成本0.84美元约为对手三分之一,并预告Grok 4.7将于3至4周内发布。

二、Ilya旗下SSI首个模型曝光,主打测试时训练

1.X网友爆料Ilya旗下SSI正探索基于TTT(测试时训练)的小型推理引擎,模型通过专门数据学习"如何学习",在解题过程中更新部分权重,小规模也能与大模型抗衡;

2.爆料称当前版本已就绪,团队正将下一代规模扩展10倍,最快8月向少数用户开放,与英伟达50亿美元投资及算力提升一个数量级的合作相呼应;

3.TTT让模型在推理时用眼前数据继续训练自己、直接改变参数,区别于外部脚手架方案,但也面临学偏、遗忘等安全挑战,消息真实性尚未证实。

三、DeepSeek上线V4 Pro正式版,强Agent能力

1.DeepSeek突然发布V4 Pro正式版,命名为DeepSeek-V4-Pro-0813,API文档率先更新,官方暂未调升使用价格;

2.跑分图显示V4 Pro在Agent相关评测表现优异,几乎可与Claude Fable 5等顶级模型媲美,用户反馈其思维链风格已出现变化;

3.此次上新恰与马斯克Grok 4.6撞车,此前V4 Flash因用户激增导致API多次性能下降、算力不足酝酿涨价,V4 Pro能否兼顾性价比受关注。

四、阿里首度开源2.4万亿参数旗舰模型Qwen3.8

1.阿里首次开源Max级旗舰模型,开放Qwen3.8-2.4T-A95B权重,总参数2.4万亿、每Token激活950亿,原生支持26万Token上下文并可扩展至101万,主打长周期自主智能体任务;

2.基准测试中PaperBench取93.0分、OSWorld-Verified 86.1分居首、CAD基准91.5分均超Fable 5,但TerminalBench、SWE-bench Pro等仍落后于GPT-5.6 Sol与Fable 5;

3.Unsloth AI用1-bit量化将模型从4.9TB压缩至397GB、缩减91%,国内API每百万Token输入12元、输出36元,与Grok 4.6、DeepSeek V4 Pro同夜发布。

五、混元推出WorldClaw,一句话生成可编辑3D世界

1.腾讯混元3D团队推出开放世界生成框架WorldClaw,用户输入一句文本即可生成可自由探索、可继续编辑的大规模3D世界,采用由粗到细的Agentic生成方式;

2.生成分意图分析与场景规划、全局地形生成、区域对象生成、场景精修四阶段,多Agent协作并借助SAM3、Blender等工具自动检查修正尺度、悬浮、穿模等问题;

3.生成的建筑、车辆、植被等均为可单独编辑复用的独立3D资产,展示了海盗岛屿、沙漠战场等案例,推动3D生成从"模型生成资产"走向"Agent编程构建世界"。

六、小红书开源dots.tts,连续自回归语音合成基座

1.小红书dots团队与上海交大X-LANCE实验室开源dots.tts,20亿参数全连续端到端自回归TTS基座,跳过离散Token量化,直接在连续隐空间逐块建模并还原波形;

2.在Seed-TTS-Eval三个子集上平均内容准确度与说话人相似度达SOTA,支持流式输出,1T1A双流模式音频首包低至54.4毫秒,SGLang单卡最高16路并行;

3.采用Apache 2.0开放六个检查点及训练、推理、微调、蒸馏全套代码,并推出支持文本、情绪、韵律、停顿四类编辑的dots.tts.edit,构成可持续扩展的语音合成基座。

七、腾讯WorkBuddy升级资料库,AI原生文档共创

1.腾讯WorkBuddy发布5.3.11版本,将资料库升级为AI原生知识管理空间,除Word、Excel、PPT外新增支持HTML、Markdown等格式,人与AI可共同读写协同编辑;

2.HTML支持人机双写,改HTML如改Word般简单,可人工改、AI改、多人协作改,改完可一键发布为公开网页链接,Markdown支持批注、框选修改与逐条审阅;

3.推出"轻应用"能力,一句话即可搭建会存数据的网站,HTML中加入CSV数据表即可实现页面与在线表格双向同步,CSV还支持存储文件。

前沿科技

八、谷歌Pixel 11系列上手,硬件半代升级却普遍涨价

1.谷歌在发布会前解禁Pixel 11系列上手,含标准版、Pro、Pro XL和Pro Fold四款,全系升级256GB起步,基础款899美元、Pro与Pro XL分别1099和1299美元、Fold达1899美元,平均涨价约100美元;

2.被媒体评为半代升级,新功能HiLight呼吸灯仅显示Gemini对话状态和来电提示且为Pro专属,基础款换4800万像素主摄、Pro系列用上2400尼特Super Actua屏,Fold折痕未改善;

3.Gemini Intelligence获较正面评价,Rambler语音、动态Gemini窗口、Magic Cue主动建议全系上线,但类智能体能力提升有限,Pixel被指已沦为Gemini的物理容器。

报告观点

九、谷歌DeepMind发Nature,四维度Agent治理框架

1.谷歌DeepMind团队在Nature发表观点文章,提出Agentic Profile框架,从自主性、效能、目标复杂度和泛化四个维度系统刻画AI Agent核心属性,超越"是否为Agent"的二元分类;

2.以AlphaGo、ChatGPT-3.5、Claude 3.5 Sonnet(含工具调用)及Waymo为案例绘制画像,指出工具接入会实质改变Agent治理属性,相同模型能力在不同部署环境下风险水平可能完全不同;

3.核心洞见是"更强的Agent不一定需要更多治理",关键在于能力类型对应的治理方式,为技术审计、权限管理、责任分配和监管分级提供共同语言。

👇加入AGI数据库,AI智能问答  

腾讯研究院AI速递 20260814图1

👇订阅下方合集,获取每日推送

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI
more
腾讯研究院AI速递 20260814
英特尔CEO真金白银跟投,200亿美元增发背后是AI豪赌还是自救?
腾讯“AI上桌”代价:单季自由现金流12年首转负,528亿烧出了什么?
Claude一举扫清2000阶以下哈达玛矩阵!AI开始清空数学“待解列表”
2026 Cadence 中国用户大会 | 系统仿真及分析、系统设计及热解决方案、SoC 系统验证创新与最佳实践、AI 驱动验证与功能验证创新实践
三星SK海力士导入AI,突破产能与良率瓶颈
华硕RTX Spark首批售罄,128GB统一内存成AI创作新宠
IBM与Together AI签署2.4亿美元协议
谷歌Pixel 11全系涨价!搭2nm芯片,存储翻倍,AI跨40多款应用干活
刚刚,中国AI交卷!40年难题56分钟破局,AI不再「学习」
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号