谷歌TPU Ironwood实测碾压英伟达B200,一行代码即可迁移PyTorch生态

科技区角 2026-09-11 11:00

【区角快讯】当AI芯片市场的硝烟从云端算力蔓延至推理成本,谷歌用一份来自SemiAnalysis的最新报告,给英伟达的统治地位带来了一次实质性的冲击。数据显示,其第七代TPU Ironwood在每美元推理性能上,最高领先英伟达B200达50%,面对尚未完全铺开的B300,这一优势更是扩大到了惊人的96%。

回想今年4月,黄仁勋曾在播客中公开质疑,称“TPU不来,Trainium不来”,暗示竞争对手不敢参与公开跑分。仅仅五个月后,谷歌便带着详实的实测数据如约而至,打破了这种沉默。此次测试基于Qwen3.5 397B FP8模型,在输入8000 token、输出1000 token的场景下,以每秒100 token的单用户吞吐为基准,TPU处理每百万token的成本仅为0.181美元。

相比之下,B200的同项成本为0.222美元,B300则高达0.276美元。这意味着TPU分别便宜了19%和34%。若进一步将中位响应时间限制在20秒以内,TPU的成本可骤降至0.098美元。值得注意的是,这种成本优势并非源于峰值算力的绝对压制——实测中TPU的物理吞吐仅领先约5%——而是得益于远低于GPU的每小时租赁价格,叠加后形成了巨大的性价比剪刀差。

除了价格层面的第一层冲击,更令英伟达忌惮的是软件生态壁垒的松动。谷歌推出了TorchTPU,利用PyTorch的PrivateUse1后端接口,让TPU直接成为原生Torch运算设备。开发者只需将一行代码从`device = torch.device('cuda')`改为`device = tpu.get_device()`,无需重写训练循环或修改模型架构,即可无缝迁移。

硬件层面,Ironwood单芯片配备192GB HBM,是上一代Trillium的6倍,能容纳更大的KV Cache;其矩阵单元采用256×256脉动阵列,原生支持FP8运算。随着自去年起开放TPU直接销售,Anthropic已采购超100万颗TPU,预计到2029年将超越DeepMind成为全球最大单一用户。预计10月PyTorch大会期间,TorchTPU将正式开源,届时迁移门槛将被彻底抹平。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
英伟达
more
英伟达,彻底改变芯片行业
英伟达千万美元驰援尼泊尔,员工请愿促成最大科技捐赠
黄仁勋高盛峰会再放豪言:英伟达明年营收或飙至6800亿美元,AI霸权远未终结
英伟达CUDA 13.4首支Win on Arm,为RTX Spark铺路
英伟达35亿美元投资联发科,两大巨头在下怎样一盘AI大棋?
黄仁勋重申英伟达AI霸权:明年营收或飙至6800亿美元,称“地球一切尽在掌握”
英伟达百亿豪赌开源生态,399美元“机器鸭”成具身智能破局点?
外媒:绝不能让英伟达收购Hugging Face
刚刚,寒武纪拿下PyTorch最高席位!与英伟达同桌
开源项目DLSS5VKLayer问世,Linux平台有望解锁英伟达DLSS 5技术
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号