
GPNPU架构融合通用编程与专用效率,打造面向大模型推理时代的新一代AI推理芯片
构建面向下一代AI推理的
全新智算底座

Analysis
.
SIMT 通用编程能力
AI主流框架兼容,一行代码实现程序运行
SIMD 矩阵计算密度
NPU级别的计算效率和能效比
3D堆叠架构
高效访存架构
10ns级别访存延迟
Scale up 算力扩展
满足10万亿级别的 MoE大模型推理需要
统一线程执行,真正承接主流开发生态
以SIMT通用执行模型为底座,兼容AI主流框架与软件生态,支持复杂控制流、动态调度与完整
推理流程承载。
通用架构也能实现 NPU 级效率
通过 SIMD、张量融合计算、混合精度执行与片上算存协同,提升有效算力、吞吐表现与单位功耗产出。
以3D堆叠重构数据供给架构
通过3D堆叠存储与分层带宽池化,提升数据带宽与访问效率,支撑长上下文与MoE等高数据吞吐场景。
面向实时智能的响应式架构
依托近核热数据驻留、低跳数互连与解码优先调度,显著改善TTFT、TPOT与尾时延表现。
从单芯片走向超节点推理平台
通过统一内存语义的高速互连与系统级扩展架构,支撑从单卡、整机到超节点的持续扩展。
DOMESTIC TECHNOLOGY

