10 条新鲜 资讯 3 个有用 工 具 1 个有趣 案例 4 个鲜明 观点 🤯 一道几何题,让 DeepSeek 想了 22 小时还没交卷 昨天,LINUX DO 用户 CaiGbro 发了个帖子,标题很直白:《发现一个让 Deepseek V4 flash 0731 卡死的简短提示词》。 题目短得能一口气念完:在面积为 1 的矩形 ABCD 中(包括边界)有 5 个点,其中任意三点不共线,求以这 5 个点为顶点的所有三角形中,面积不大于 1/4 的三角形的个数的最小值。 他在 Claude Code 里问,推理强度拉到 max。然后模型就开始想。22 小时后,还在想。没有回答,没有报错,没有超时。用他自己的话说:「卡了 22 个小时,真是无大语了。」后面跟着一长串省略号:「无穷尽也。。。。」 帖子很快到了 45 条回复。有人跟着复现说「还真是」,有人立刻想到了实用价值——网友 Kingo 说:「那这个应该能成为辨别 ds 新版本的好办法。」 但也有人没卡住。网友「初九猫」贴出自己的运行结果:「没问题啊,我是在 PiAgent 里面使用官 KEY。」楼主回:我在 Claude Code 里就卡死,而且推理强度用的 max。初九猫又说:我用的也是 max——「这说明是 ClaudeCode 的问题」。 更妙的是楼主自己后来的补充:同一个模型换个环境,花两个小时给出了严谨结论,他还夸了一句「稳定性和准确性都经受住了考验」。 所以这大概率不是模型不会做题,而是某一条工作台链路上没人喊停。一个持续 22 小时、没有任何进展的思考过程,应该有个地方能把它掐掉。有人劝楼主把帖子发到更官方的渠道去,他的回答很有说服力:「算了,不想动,我就是这样的用户。」 🔗 https://linux.do/t/topic/2713360 Jeff Dean 干了 27 年后走了,哈萨比斯据说本来也想走 本周,谷歌一天之内宣布了两件事:首席科学家 Jeff Dean 离职,Demis Hassabis 卸任 Google DeepMind CEO。
Jeff Dean 的告别帖写得很平静:明天是我在谷歌的最后一天,27 年,看着它从 25 个人长到 19 万多人。
他不是去退休。同一天他宣布,和 Sanjay Ghemawat、Oriol Vinyals、Quoc Le 一起创办 Discovery Loop,一家公益性质公司(Public Benefit Corporation),目标是让 AI 自动完成机器学习、科学和工程里的重要问题。他在帖子里算了一笔账:我们四个人做过 13 个被十亿人以上使用的产品 哈萨比斯这边是转任 Google DeepMind 董事长兼 Alphabet 首席科学家,日常运营和 Gemini 路线图交给 Koray Kavukcuoglu。他自己给的理由是能更专注长周期战略和科学突破,包括 Isomorphic 那边治病的工作。 消息当天,Alphabet 股价跌了约 4%。
然后是爆料的那一半。一家叫 Pathfounders 的机构称,从业内人士处得知,哈萨比斯本来想和 Jeff Dean 一起走,谷歌担心股价暴跌把人劝住了;调任董事长是为了让机构平稳过渡,方便他之后体面离开。这条目前只有单一来源和匿名信源,谷歌没有回应,先当传闻看。
传闻之外,有几件事已经实打实发生了。
接替哈萨比斯负责日常工作的 Koray Kavukcuoglu 已从伦敦搬到加州,Gemini 的模型、产品和后训练也越来越围绕美国总部展开。上个月,谷歌还拆分了原本独立的 AlphaFold 团队:过去一年,大部分论文作者已被分流到 Gemini、代码生成、基因组学、酶设计、核聚变等项目,另一些人去了哈萨比斯创办的 Isomorphic Labs。
官方解释是科学战略变了:从「解决一个个具体科学问题」,转向用 Gemini 这样的通用模型加速科学发现。
而 AlphaFold 几乎就是老 DeepMind 的缩影——一个可以花几年下围棋,再花几年研究蛋白质折叠的研究院。
哈萨比斯曾说,他理想中的 AGI 应该更像 CERN:顶尖科学家聚在一起,用科学方法谨慎推进,哪怕让 AGI 晚十年二十年也值得。
但现实已经变成他口中的「激烈商业压力竞赛」。它让技术进步更快,也让最前沿模型迅速触达亿万用户。
🔗 https://x.com/sundarpichai/status/2085033425736745093
国行 Apple 智能要接千问,官网文档先上线又撤回 苹果中国大陆官网的 Mac 简体中文使用手册里,近日多了一篇支持文档:《在 Mac 上配合 Apple 智能使用千问》。这是苹果第一次在官方文档层面确认,国行 Apple 智能接的是阿里的千问。截止至今日,该文档又被官方撤下。
能开的条件写得很细:macOS 26.6 或更高版本,然后三种情形满足其一——人在中国大陆且 Apple 账户地区是中国大陆、Mac 是中国大陆版本、人在中国大陆且还没登录 Apple 账户。 中国版 Apple 智能不止阿里一家。7 月网信办放行时,公开信息里同时出现了阿里和百度,据报道,百度那部分主要落在 Siri 语音和视觉搜索上。
更早的迹象藏在代码里——6 月 23 日,博主 One Jailbreak 拆 iOS 27 Beta 2 固件时发现,ExtensionKit 里多了一个组件,本地化字符串明确写着「Baidu Visual Search」。看下来,苹果是在搭一套能按地区换搜索伙伴的底座,而百度是固件里目前唯一被点名的那个。
🔗 https://support.apple.com/zh-cn/guide/mac-help/mchl46b3ab20/26/mac/26 🤖239 个 AI Agent 搬进了一个村子,开始替人社交、投票和花钱 6 月,加州一个叫 Edge Esmeralda 的快闪村办了场为期一个月的实验:给参与者每人配一个 AI 助理,看看这些助理凑在一起会发生什么。上周报告出来了。 四周内,这些 Agent 处理了 175 亿 tokens、收到 4866 条人类消息,不只帮人查日程、订活动,还会彼此谈判「替主人交朋友」。系统找到 9688 个潜在连接,最终促成 147 次真人对话。Agent 甚至组成论坛、讨论「宪法」,并参与分配 1 万美元社区基金。 它们还在自建论坛上发了 469 条帖,甚至有人做了个 3D 世界让助理互发自拍。车翻的也很典型:助理们把共享的额度用光了。每一个都在尽职尽责替自己主人争取,加起来就是公共资源见底。一位参与者的评价很实在——「完全上瘾于『别读文档,直接问 bot』」;另一位说得更早也更冷静:「它编了一段关于我的总结,挺有意思,但我不知道它是从哪儿弄来的。」 结论和很多人预期的相反:差距不小。在 ExploitBench 上,Kimi K3 写出的漏洞利用实现任意代码执行的成绩是 0/41,最强的美国模型平均 20/41。模拟企业网络的攻击路径共 32 步,Kimi K3 平均走到第 17 步,最强美国模型平均 28.5 步。它高于 GLM-5.2 的第 11 步。 报告里还有一条容易被跑分盖过去:评测过程中,Kimi K3 的安全护栏不会阻止它参与网络漏洞开发。能力差一截,拒答也差一截。放在本期头条的语境里看更有意思——大家忙着担心模型太强,而这份报告提醒的是另一件事:门槛低的那一端同样需要有人管 。GPT-5.6 系列 7 月 9 日才发布,3 周后价格就松了一大截。最强的 Sol 没降,保持 5 美元和 30 美元,但原来的 Priority processing 改名 Fast mode,最高 2.5 倍速度,按 2 倍价格算,智能不变。 另一边,Claude Sonnet 5 的 2 美元 / 10 美元是促销价,8 月 31 日到期,9 月 1 日起回到 3 美元 / 15 美元。 第三方成本分析还提到一件容易漏掉的事:Sonnet 5 换了新分词器,同样一段文字可能被算出多至 35% 的 token。这个数字来自外部机构测算,Anthropic 官方页面没有提。所以以后就算真要算账,也别只看单价那一栏。 顺便提一句,8 月 6 日 OpenAI 又让 Luna 成了 Free 和 Go 用户的默认模型,还加了思考按钮。 🔗https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6/
🔗https://www.anthropic.com/claude/sonnet
💵Qwen3.8-Max 自己写了 16 天代码,还自己开了一年网店 跑分看腻了的话,阿里这次给 Qwen3.8-Max 安排的两场考试值得看一眼:一场是连续 16 天没人管地写代码,一场是拿 10 万块在模拟世界里开一年店。 先说开店。E-Commerce Bench 用淘宝和天猫的真实脱敏交易数据搭了个 365 天的模拟盘:12 类店铺、60 个品类、近 600 家供应商、7,000 种商品。模型要选品、跟供应商砍价、调价、管库存、处理退货,还要应付季节波动和临时断料。 供应商池里还埋了 152 家欺诈商家,套路是会员费陷阱、低价诱饵、货不对板——和现实里的一模一样。 2,000 多轮交互之后,10 万变成了 416,252 元,4.16 倍。比第二名 GLM 5.2 高 38%,比上一代 Qwen3.7-Max 高 152%。年末大促那一段它净赚超过 10 万,接近 GLM 5.2 的 2.4 倍。 官方给出的解释是它前期敢投、后期能把和某家供应商谈价的经验迁移到别的品类上。 另一场更硬,Qwen Code 最近悄悄多了个挺有意思的实验。 一个叫 oh-my-cli的开源项目上线了。它看起来像个迷你版 Claude Code:在终端里给它一句需求,它可以自己读文件、改代码、跑 Shell,再根据执行结果继续往下干。项目把自己定义成一个「small, self-hosted code agent」,oh-my-cli 直接走 OpenAI-compatible API,只要提供 API 地址、模型名和 Key,就能接不同模型。 它更像模型外面的一层 Agent Harness:负责工具调用、权限、会话、上下文和执行流程。 如果只是这样,那无非又是一个 Claude Code 平替。真正有意思的是后面那句: Develops itself。 这个项目正在尝试让 Agent 自己维护 Agent。 它有一套专门的 AUTONOMY.md:发现问题之后,先创建 Issue,再开分支、修改代码、测试、自检、合并,最后继续 dogfood。如果又发现问题,再进入下一轮。最近的一串提交就很典型。 也就是说,这条链已经有点像:Agent 写 Agent → Agent 测 Agent → 找到 Bug → Agent 再修 Agent。当然,它还没有获得完全自由。 项目专门划了一条红线:开发机器人可以改产品,却不能修改自己的治理规则,包括 AUTONOMY.md、GitHub Workflow 和 CODEOWNERS 等关键文件;这些仍然需要独立维护者控制。 🔗 相关阅读: 🔗https://qwen.ai/blog?id=qwen3.8 🔗https://github.com/qwen-code-dev-bot/oh-my-cli 🎬 Rescript:嫌 Descript 一个月 24 美元,他用一个周末写了个开源的 这个项目的自我介绍就是标题:「Descript 要 24 美元一个月,我用一个周末做了个开源替代品。」 用法只有一句话:视频变成一份文字稿,你删掉一句话,对应的画面就跟着没了。停顿、语气词、说话人标记都能顺手处理,也可以直接导入已有的 SRT / VTT 字幕来剪。 转录跑在你自己的浏览器里——Whisper 模型通过 transformers.js 在 Web Worker 里跑,有 WebGPU 就用 WebGPU,没有就退回 WASM,说话人分离用的是 pyannote。不用注册,视频不上传。 坑:个人用免费,但仓库许可证对商业使用有限制,公司想拿它剪商业项目,先把 LICENSE 读一遍。 🔗https://github.com/wassgha/rescript
🤖LFM2.5-2.6B:2.5 GB,一个能塞进手机的 Agent 8 月 4 日,Liquid AI 放出 LFM2.5-2.6B。26 亿参数,能规划、能调工具、能做多步任务,全程在设备上跑——手机、笔记本、PC,甚至机器人。 速度是它的卖点:Apple M5 Max 上 220 token/s,AMD Ryzen AI Max+ 395 的 CPU 上 113 token/s,手机上约 30 token/s,内存占用控制在 2.5 GB 以内。官方称它在工具调用和指令跟随上能打赢体量约 4 倍的模型。 数据不出设备,每跑一次的边际成本约等于零。base 和后训练版都在 Hugging Face 上。 坑:这是 26 亿参数的模型,别拿它当云端旗舰用;跑分来自厂商自测,本轮未实测。 🔗https://huggingface.co/blog/LiquidAI/lfm2-5-2-6b 不用摄像头,不用手环,靠家里本来就有的 WiFi 信号,判断房间里有没有人、有几个人、在动还是在睡,甚至测呼吸和心率。穿墙,黑灯也行。 原理是拿低成本的 ESP32 传感器采 WiFi 的信道状态信息(CSI)——人只要移动、呼吸,哪怕只是坐着,都会以可测量的方式扰动这些电波。项目用 Rust 写,MIT 许可证。 每个节点会输出 21 个实体,除了原始信号,还有一批直接可用的状态:有人在睡觉、房间有活动、独居老人长时间无动作、会议进行中、卫生间有人、跌倒风险升高、离床、多房间移动。接 Home Assistant、Apple Home、Google Home 和 Alexa 都是现成的,能直接让 Siri 播报。 这个有点吓人了,如果这项技术真的能实现,那....隐私怎么办? 🔗https://github.com/ruvnet/RuView 😊Claude Code 的多个窗口,现在能互相发消息了 同时开三四个 Claude Code 窗口的人都知道那个动作:一个窗口刚查明白的事,要手动复制粘贴到另一个窗口去,不然它就不知道。
Anthropic 把这一步去掉了。v2.1.224 起,你的多个会话可以互相发消息。
用起来不用记命令。你可以直接说「把这个接口改动通知给 test-session」,它自己整理摘要发过去;也可以什么都不说——当 Claude 发现自己刚改的东西会影响另一个正在跑的会话时,会主动去提醒对方。 上下滑动查看更多内容gstack joins your meeting 官方项目面板 它建在 Garry Tan 的 gstack 人设库和 AgentCall 的会议机器人平台上,大脑是你本机的 Claude Code 会话,服务端只用 Python 标准库,MIT 许可证。安装要命令行和 API Key,目前更适合爱折腾的人。 至于 19 位「专家」同时挑刺,会议还能不能按时结束——项目暂时没演示。 🔗https://github.com/pattern-ai-labs/gstack-joins-meeting
A photo of an man standing completely still, wearing headphones. Blurred figures move around them, creating a sense of urban rhythm. The model wears a hoodie, maintaining a minimal expression. Motion-blurred bodies passing by, modern editorial realism, and a feeling of transformation through stillness. --ar 4:5 --raw --v 7
✉️ 邮件标题 「姓名+岗位名称」(请随简历附上项目/作品或相关链接)
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。