谷歌TPU Ironwood实测碾压英伟达B200,一行代码即可迁移PyTorch生态

科技区角 2026-09-11 11:00

【区角快讯】当AI芯片市场的硝烟从云端算力蔓延至推理成本,谷歌用一份来自SemiAnalysis的最新报告,给英伟达的统治地位带来了一次实质性的冲击。数据显示,其第七代TPU Ironwood在每美元推理性能上,最高领先英伟达B200达50%,面对尚未完全铺开的B300,这一优势更是扩大到了惊人的96%。

回想今年4月,黄仁勋曾在播客中公开质疑,称“TPU不来,Trainium不来”,暗示竞争对手不敢参与公开跑分。仅仅五个月后,谷歌便带着详实的实测数据如约而至,打破了这种沉默。此次测试基于Qwen3.5 397B FP8模型,在输入8000 token、输出1000 token的场景下,以每秒100 token的单用户吞吐为基准,TPU处理每百万token的成本仅为0.181美元。

相比之下,B200的同项成本为0.222美元,B300则高达0.276美元。这意味着TPU分别便宜了19%和34%。若进一步将中位响应时间限制在20秒以内,TPU的成本可骤降至0.098美元。值得注意的是,这种成本优势并非源于峰值算力的绝对压制——实测中TPU的物理吞吐仅领先约5%——而是得益于远低于GPU的每小时租赁价格,叠加后形成了巨大的性价比剪刀差。

除了价格层面的第一层冲击,更令英伟达忌惮的是软件生态壁垒的松动。谷歌推出了TorchTPU,利用PyTorch的PrivateUse1后端接口,让TPU直接成为原生Torch运算设备。开发者只需将一行代码从`device = torch.device('cuda')`改为`device = tpu.get_device()`,无需重写训练循环或修改模型架构,即可无缝迁移。

硬件层面,Ironwood单芯片配备192GB HBM,是上一代Trillium的6倍,能容纳更大的KV Cache;其矩阵单元采用256×256脉动阵列,原生支持FP8运算。随着自去年起开放TPU直接销售,Anthropic已采购超100万颗TPU,预计到2029年将超越DeepMind成为全球最大单一用户。预计10月PyTorch大会期间,TorchTPU将正式开源,届时迁移门槛将被彻底抹平。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
英伟达
more
黄仁勋高盛峰会再放豪言:英伟达明年营收或飙至6800亿美元,AI霸权远未终结
印度拟对小米启动调查,宁德时代辟谣不让普工上厕所,英伟达被查,OPPO、华为等加入全球最大影像专利许可项目,这就是今天的其他大新闻!
突发!英伟达被查
汽车早餐 | 预计今晚24时油价上调;英伟达被调查;众泰称全新车型进入批量试制阶段
英伟达HBM策略转变背后
英伟达,疯狂投资,近千亿美元
疯狂买买买,英伟达的野心何在?
刚刚,寒武纪拿下PyTorch最高席位!与英伟达同桌
又一家车厂,自研芯片,抛弃英伟达
英伟达DLSS SDK更新:预设F正式入驻,RTX 5090耗时微增
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号