谷歌推最强Gemini推理模型:月费1800,已拿奥赛金牌,性能超OpenAI o3和Grok 4

智东西 2025-08-02 07:21

资讯配图资讯配图

谷歌把拿金牌的模型,开放给了至尊版订阅用户。
作者 |  ZeR0
编辑 |  漠影
智东西8月2日报道,昨夜,谷歌推出其迄今最强推理模型Gemini 2.5 Deep Think。
这是最近在今年国际数学奥林匹克(IMO)上“拿金牌”的模型的变体。近期高级版Gemini Deep Think完美解答了IMO 6道题目中的5道,总分35分(满分42分),达到金牌水平。
该模型需要几个小时才能推理出复杂的数学问题。新发布的版本在日常使用中速度更快、更易用,根据内部评估,在2025年IMO基准测试中仍达到铜牌水平。
谷歌在今年5月的I/O开发者大会上首次预览了Gemini 2.5 Deep Think。新版本进行了“重大改进”。在具有挑战性的编程、科学、知识、推理基准测试中,与OpenAI o3、Grok 4等其他不使用工具的模型相比,Gemini 2.5 Deep Think在LiveCodeBench V6和Humanity's Last Exam均取得最佳性能。
资讯配图
Gemini app中的Deep Think模型,使用思考技巧来提供更详细、更有创意和更周到的回答,甚至可以帮助数学家来测试数学猜想,还能提高Web开发任务的美观性。
资讯配图
Deep Think支持文本、图像、音频、视频等输入和1M tokens上下文窗口,输出长度为192K tokens。
其工作原理是利用谷歌的并行思维技术,能同时生成多个想法,并同时进行思考,甚至随着时间的推移不断修改或整合不同的想法,最终得出最佳答案。
此外,通过延长推理时间或“思考时间”,谷歌给了Gemini更多的时间来探索不同的假设,并为复杂问题找到创造性的解决方案。
谷歌还开发了新颖的强化学习技术,鼓励模型利用这些扩展的推理路径,从而使Deep Think随时间推移成为更好、更直观的问题解决者。
Deep Think可以帮助人们解决需要创造力、战略规划和逐步改进的问题,例如:
    • 迭代开发和设计:在需要逐块构建复杂事物的任务上的表现出色,比如可以提高网络开发任务的美学和功能。
    • 科学和数学发现:可推理出高度复杂的问题,通过复杂的科学文献帮助制定和探索数学猜想或推理,可能加速发现之路。
    • 算法开发和代码:在棘手的编码问题上特别出色,其中问题制定和仔细考虑权衡和时间复杂性是最重要的。
    目前仅有最高级别的Google AI Ultra订阅者可选用“Deep Think”,每月订阅费为249.99美元(约合人民币1803元)。
    Deep Think自动与代码执行和谷歌搜索等工具配合使用,并能产生更长的响应。
    同时,达到IMO金牌水平的Deep Think模型将进一步测试,并向一小部分数学家和学者分享,用于辅助研究。谷歌计划利用这些反馈来完善该模型的未来版本。
    谷歌还正在努力在未来几周内通过Gemini API向一组受信任的测试人员发布带和不带工具的Deep Think,以更好地了解其对开发者和企业用例的可用性。
    资讯配图

    (本文系网易新闻•网易号特色内容激励计划签约账号【智东西】原创内容,未经账号授权,禁止随意转载。)

    资讯配图

    声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。 
    AI EMI
    more
    媒体观察 | “同球共济”:AI全球治理需要超越零和博弈的智慧
    论坛直击 | 斗象成功主办WAIC 2025世界人工智能大会AI产业技术安全论坛
    WAIC 2025:从技术破局到场景应用深入,AI实践开始跨越三大拐点
    谷歌奥赛夺牌AI「深度思考」正式开放!谷歌Deep Think技术细节首曝:并行思考+强化学习
    【投融资】华人创业已低调超越ScaleAI,零融资的SurgeAI年收10亿美金
    用 AI 生图的外卖店,我劝你别点
    摩尔线程副总裁王华:AI工厂全栈技术重构算力基建,开启国产 GPU 黄金时代
    苹果的AI“烦恼”
    深圳大学教授创业AI芯片主动式散热,「锐盟半导体」再获数千万融资|早起看早期
    RISC-V在AI HPC市场真的发展起来了吗?专访RISC-V International CEO
    Copyright © 2025 成都科技区角科技有限公司
    蜀ICP备2025143415号-1
      
    川公网安备51015602001305号