生成式AI
一、判断模型Jev出圈实测,40秒完成724条广告分类
1.Jev定位为System One判断模型,可对程序状态或文本快速返回Noul、Choice、Score等结构化结果与概率;
2.开发者约40秒分析37个品牌724条实时广告并产生8724次判断,Token成本约9美分,单次调用约0.44秒;
3.已被用于压缩Claude Code上下文,也可驱动浏览器Agent完成读页、候选动作、选型与执行的完整循环。
二、Qwen-Image-2.1开源,7B模型原生支持透明图像
1.阿里开源Qwen-Image-2.1,将文生图与图像编辑整合进同一模型,视觉生成部分为32层Single-Stream DiT、仅7B参数,并原生支持透明图像的生成与编辑;
2.采用混合粒度注意力与KV Cache复用机制,文本用Token级因果掩码、图像用Chunk级掩码,多图输入场景下推理效率与显存开销改善明显;
3.编辑能力支持最多10张参考图输入,可用圈选、涂抹或独立掩码指定区域,强化人像与商品一致性,并覆盖全景图、信息图与分镜生成。
三、阶跃发布Step 5 Preview,成本为Opus 5的1/8
1.阶跃推出旗舰模型Step 5 Preview,稀疏MoE架构总参数600B、激活仅27B,支持100万Token上下文与文本、视觉输入,10月15日将释放权重;
2.在Artificial Analysis智能指数中取得44分,位列全球开源模型前三,单任务成本仅为Claude Opus 5的1/8;
3.长周期任务实测中,其用约22小时将MLA内核峰值性能优化至508 TFLOPS,超过Claude Opus 5的493 TFLOPS,并在金融研究等评测中表现居前。
四、腾讯混元推出WebCraftBench,实测AI生成网页
1.腾讯混元联合清华、北大提出WebCraftBench,把软件测试方法引入网页生成评测,让智能体真实操作网页,再从美观度、易用性与需求符合度三个维度打分;
2.基准含369条真实需求与5088条验收标准,评测17个前沿模型、6273个生成应用,自动插桩成功率99.89%,覆盖率引导把函数覆盖率中位数从91.9%提至94.3%;
3.在197组人类偏好对比中一致率达85.3%,结果显示美观度与易用性在单个应用上的相关系数仅0.36,界面好看并不代表交互可靠。
五、微信团队开源WeKnora,企业知识底座揽26.8K星
1.微信团队以MIT协议开源企业知识管理框架WeKnora,GitHub已获26.8K星,覆盖RAG问答、ReAct Agent与自动Wiki三大核心能力;
2.检索层采用向量加BM25混合召回并可结合知识图谱,保留原始目录结构、支持直接编辑单条切片并自动重建索引,保留版本diff与回滚;
3.v0.8.0新增会话级Skill沙箱与跨会话长期记忆,可同步Notion、语雀、飞书等数据源,并作为MCP Server接入公众号、小程序等微信生态入口。
前沿科技
六、稚晖君连发Q1与T1两款家庭机器人,19999元起
1.启元机器人发布面向家庭的Q1与T1,标准版均为19999元,探索版Q1与Pro版T1分别为26999元和29999元,10月1日起按订单陆续发货;
2.Q1身高88厘米、具备22个自由度,采用全身力控与防夹手设计,开放100多项原子能力与图形化编程,外壳、性格与音色均可定制;
3.T1支持双足与四足形态自主切换,配9个传感器与足部清洁基站;公司同步发布PrimeMotion、PrimeGo、PrimeVista三款模型,下线节拍2.5分钟一台。
报告观点
七、Jake Wharton拒用AI:AI账单终将贵过程序员
1.Kotlin与Android资深工程师Jake Wharton公布求职九条准则,第一条即不进AI公司、不做AI产品、不接受强制使用AI,代价是放弃约80%的机会;
2.他判断生成式AI由风投补贴支撑,GitHub Copilot转为按量计费后,部分开发者月账单从30美元涨至约1400美元,成本回归后AI写代码将贵过被裁的工程师;
3.他认为敲样板代码从来不是编程最难的部分,架构设计与长期维护才是,开发者不应把核心工程能力建立在统计预测之上。
八、YC复盘:硬科技占比升至20%,应用团队自训模型
1.YC披露近12至18个月数据,硬科技在录取公司中占比从8%升至20%,机器人、工业制造、半导体与电力基础设施等赛道均扩大3至5倍;
2.提供端到端完成任务的公司占比从约10%升至25%以上,三个月加速营后MRR中位数从8000美元升至近2万美元,首次出现单批次做到七位数收入的公司;
3.向实验室卖训练数据与RL环境成为大生意,两年内十余家被投公司年收入过千万美元;单人创始人比例从5%升至18%,三四十岁资深从业者反而更能打。
九、Jev创始人:RLHF是弯路,自主自动化才是下一程
1.RLHF论文共同作者、TypeSafe创始人阿尔梅达认为,大模型在有人在回路的协助任务上表现惊人,在需要移出人类的自动化任务上却不堪使用;
2.他称幻觉源自奖励模型的不对称性,坦承“不知道”会被惩罚、自信编造反而得高分,因此RLHF是一条“始料未及的弯路”,Claude Code仍属协助时代产物;
3.TypeSafe选择第三条路线RLCD,优化校准决策而非人类偏好或数理正确性,Jev上线24小时被Vercel AI Gateway近13%付费团队采用,两天内出现6个克隆项目。
👇加入AGI数据库,AI智能问答

👇订阅下方合集,获取每日推送