

能耗账:数据在加速器孤岛与外部内存之间往返,数据搬运本身就会产生功耗开销; 时延账:跨模块传输叠加排队延迟,即便最优调度器也无法完全掩盖; 工程账:每个加速器拥有独立工具链、驱动和安全模型,集成与维护需要投入巨大人力工程成本。


原生大规模并行与强可编程性:GPU 本质是大规模并行处理器,天然适配复杂多变、持续涌现的 AI 算子和通用计算任务,提供充足灵活的编程空间。
规模化部署基础:GPU 已广泛应用于几乎所有带可视化能力的边缘终端,是硬件标配模块,负责显示和图形处理。
成熟的生态体系:拥有成熟驱动程序、标准 API(如 DirectX, Vulkan, OpenCL)以及庞大开发者生态,能够快速吸引并赋能开发者。
不可替代的图形渲染职能:任何带显示功能的设备都必须完成图形渲染,GPU 是承担该职责的硬件基础,无法被其他处理器完全取代。



单核基础规格(1GHz):拥有 2 TFLOPS FP32 算力,矩阵运算性能达到 32 TOPS(INT8/FP8),纹理吞吐高达 64Gtexel/s。AI 算力相比 D 系列提升 4 倍以上。
卓越的扩展性:支持 1 到 4 核灵活配置,并已为多芯粒(Chiplet)架构做好准备。在峰值配置下,支持最大 1TB 寻址空间和 768GB/s 峰值带宽,通过 AXI 互联兼容 HBM、LPDDR、GDDR 等各类内存类型。
完整的多精度支持:E 系列首次将 BF16、MXFP8、MXFP4 等格式引入嵌入式领域:图形着色与参考路径采用 FP32/FP16;主流推理使用 BF16、INT8、FP8;面向大模型的低精度推理则采用 MXFP8、MXFP4 等微缩放格式,适配带宽受限场景,提升计算密度。所有格式通过行业标准的 Vulkan 协作矩阵扩展提供,底层仍复用同一套软件栈。
智能调度:采用 RISC-V 固件调度器,可并行调度图形与 AI 任务。支持多达 16 个虚拟机(VM),提供 QoS 优先级和内存隔离,完美适配车载云游戏、安全隔离等复杂场景。
GPU-only:纯 GPU 方案,适合车载、工业这类产品生命周期长、对可编程性要求极高的 AI 系统; GPU 为主 + 辅助 NPU:可编程计算作为核心,搭配定向 AI 加速单元; NPU 为主 + GPU 协处理器:主打峰值推理吞吐,GPU 负责图形渲染与通用计算; GPU/NPU 均衡协同:性能、能效与可编程性按需求配比。


Prefill(预填充)阶段,即 “问”—— 处理输入提示词,为每个上下文 token 执行海量矩阵计算,决定首 token 生成时间(TTFT,Time to First Token); Decode(解码)阶段,即 “答”—— 逐 token 生成回答,每个 token 都需要搬运数据、重载权重,吞吐量(tokens/s)高度依赖 SoC 的系统内存带宽。
