芝能智芯出品在 Hot Chips 2026 上,Intel 展示了 Crescent Island,一颗面向智能体 AI 推理的加速器。
没有使用 HBM,而是选择了 LPDDR5X,通常用于手机和轻薄本的内存。容量从 160GB 到 480GB 可选,远高于同价位 HBM 方案。

Intel 的想法是大模型推理,尤其是智能体工作负载,瓶颈常在内存容量上,内存带宽只是次要因素。
如果模型权重能全部驻留在本地内存里,就不需要频繁从外部存储或其他节点搬运数据,推理延迟和成本都会下降。
这和 NVIDIA、AMD 用 HBM 堆带宽的路线形成鲜明对比。
两条路线没有对错,只是面向的工作负载不同:训练和超大模型需要 HBM 的极致带宽,中等规模模型的高并发推理往往更需要大内存容量和低功耗。

智能体AI的计算需求和传统推理不一样
智能体(Agent)工作负载不只是连续生成 Token。它要调用工具、检索文档、执行代码、处理多轮对话。这些任务的特点是:批量小、延迟敏感、上下文长度变化大、中间状态多。
Crescent Island 的设计就是围绕这些特征展开的。它基于 Intel Xe 架构,加入了面向 AI 的计算优化和 RAS(可靠性、可用性、可维护性)特性。Intel 看重的是“每瓦 Token 数”,峰值 FLOPS 退居其次。
这是一个务实的定位。在推理市场,客户最终关心每个 Token 的成本,基准测试跑分只是次要考量。如果 LPDDR5X 方案能用更低的功耗和成本,在中等模型上提供足够的推理性能,它就有自己的市场。

大内存容量的优势:权重常驻和推测解码
Crescent Island 最高 480GB 的 LPDDR5X 容量,让几十亿到上百亿参数的模型可以把全部权重放在本地内存里。
◎ 第一,推理时不需要从其他设备或存储层级搬运权重,延迟更低,也减少了网络流量。
◎ 第二,支持推测解码(Speculative Decoding),用一个小模型快速生成候选 Token,再用大模型验证,从而在不损失质量的前提下提高生成速度。
推测解码需要同时加载多个模型或额外的草稿模型,对内存容量有要求。
Intel 在演讲中展示了 Crescent Island 在智能体推理总占用中的表现:所有权重常驻内存,减少了跨节点通信和外部存储访问。
对部署大量中等模型的云厂商和企业来说,这种"大内存+够用带宽"的组合,可能比"HBM+极致带宽"更划算。

LPDDR的代价:带宽和可升级性
LPDDR5X 也有短板。它的带宽低于 HBM,而且内存焊死在板上,不能像 DDR 那样灵活升级。如果客户的模型规模增长超过预期,可能得更换整卡,没法靠加内存条解决。
LPDDR 的长期供货和车规/工规认证,也需要 Intel 和内存厂商共同保障。在数据中心环境下,LPDDR 的稳定性和寿命还需要大规模部署验证。
Intel 的选择是一次明确的市场细分:不和 NVIDIA 在 HBM 高端训练市场正面硬刚,而是用大内存、低功耗、低成本的方案,切智能体推理和中等模型服务的市场。这个市场正在快速增长,而且对成本极度敏感。
Crescent Island 给国内 AI 芯片创业者一个提醒:HBM 未必是所有加速器都需要的。根据目标场景选择内存类型,比盲目追高带宽更重要。
如果目标是大模型训练和超大模型推理,HBM 几乎是必须的。但如果目标是百亿参数模型的高并发推理、智能体服务、边缘和企业部署,LPDDR 或 DDR 方案可能在成本、功耗和供货上更有优势。
国内不少 AI 芯片项目一上来就对标 HBM 和高端训练,导致成本高、供货难、软件生态压力大。
Crescent Island 的路线说明:找准一个细分场景,用合适的内存和架构做深做透,比在所有指标上追平头部更现实。
Intel 的 AI 路线几经波折,Crescent Island 能否跑出来还要看市场,智能体推理时代,AI 加速器的最优解可能是更大的内存,大力出奇迹。