RTX 5090移动版与M5 Max本地AI实测:中小模型碾压,超长上下文显存成瓶颈

科技区角 2026-08-21 12:01

【区角快讯】当顶级移动GPU遇上苹果自研芯片的巅峰之作,本地大模型推理的性能天平究竟向哪边倾斜?博主Alex Ziskind近期的一项对比测试给出了颇具戏剧性的答案。在搭载最新雷蛇灵刃18笔记本的平台上,英伟达RTX 5090移动版凭借24GB显存,在处理Gemma 4 12B、Qwen3.5 27B等主流规模模型时,展现出惊人的算力优势。

数据显示,在12B至35B参数规模的模型中,RTX 5090的表现堪称“降维打击”。以Gemma 4 12B为例,其提示词处理速度高达4110 tokens/sec,相比M5 Max的1762 tokens/sec,领先幅度达到133%。即便是面对Qwen3.5 27B,RTX 5090依然保持109%的巨大差距;即便升级到35B级别的Qwen3.6 35B A3B,其在提示词处理上仍保有32%的优势。对于追求高频短文本生成的发烧友而言,这无疑是极具吸引力的性能指标。

然而,战局在进入超大模型与超长上下文场景后发生了逆转。当测试转向Qwen3 4B模型的26万超长上下文时,RTX 5090的24GB显存迅速触及天花板,生成速度断崖式下跌至25.28 Token/秒。相比之下,拥有128GB统一内存的M5 Max则显得游刃有余,稳定输出181.40 Token/秒,领先优势接近7倍。

更直观的对比来自RTX 5090自身的数据波动:在68K上下文条件下,它还能维持160.36 tokens/sec的速度;一旦上下文扩展至262144,受限于显存容量,性能暴跌84.2%,吞吐量仅剩21-25 tokens/sec。这一结果清晰地表明,若应用场景涉及海量文档分析或超长对话,显存容量的权重或许已超越单纯算力,成为决定体验的关键变量。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI
more
全国首个AI4E千卡集群国赛首秀,国产算力从“能用”迈向“好用”
AI洗稿黑产现形:晋中警方斩断利用实名账号造谣牟利链条
物理AI落地家庭,追觅重构硬件的生命曲线
Gen1.5 模型带来重要进展:物理 AI 正在接近 GPT3 时刻
图解芯技术 | AI 算力背后的并行编程体系
失业小哥7000行代码,复刻了AMD重金收购的AI芯片!
2026世界机器人大会:从Model到Organization,AI进入「群智」时刻
2026 高通 Physical AI 开发者实战营火热报名中
百度AI云增长50%,没能打消焦虑
联想ThinkPad E14 Gen 8北美上市,锐龙AI 7加持起售约7500元
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号