重新定义 AI 推理基础设施

GPNPU架构融合通用编程与专用效率,打造面向大模型推理时代的新一代AI推理芯片

构建面向下一代AI推理的

全新智算底座

高性能计算高性能计算
灵活编程灵活编程
高能效比高能效比
大模型优化大模型优化

Analysis

架构解析

.

GPGPU

GPGPU

通用性

SIMT 通用编程能力
AI主流框架兼容,一行代码实现程序运行

NPU

NPU

高效性

SIMD 矩阵计算密度
NPU级别的计算效率和能效比

近存计算

近存计算

大带宽、低延时

3D堆叠架构
高效访存架构
10ns级别访存延迟

算力积木

算力积木

超节点

Scale up 算力扩展
满足10万亿级别的 MoE大模型推理需要

通用性

通用性

统一线程执行,真正承接主流开发生态

以SIMT通用执行模型为底座,兼容AI主流框架与软件生态,支持复杂控制流、动态调度与完整
推理流程承载。

高效性

高效性

通用架构也能实现 NPU 级效率

通过 SIMD、张量融合计算、混合精度执行与片上算存协同,提升有效算力、吞吐表现与单位功耗产出。

大宽带

大宽带

以3D堆叠重构数据供给架构

通过3D堆叠存储与分层带宽池化,提升数据带宽与访问效率,支撑长上下文与MoE等高数据吞吐场景。

低延时

低延时

面向实时智能的响应式架构

依托近核热数据驻留、低跳数互连与解码优先调度,显著改善TTFT、TPOT与尾时延表现。

超节点

超节点

从单芯片走向超节点推理平台

通过统一内存语义的高速互连与系统级扩展架构,支撑从单卡、整机到超节点的持续扩展。

DOMESTIC TECHNOLOGY

IFWA软件栈

GPNPU 架构软件栈

从统一线程执行到底层高速互连,从张量融合计算到 3D Memory带宽体系,GPNPU以五大关键能力重构AI推理芯片的能力边界。

0755 2360 7360