
云端大算力推理芯片

针对百万长上下文Prefill性能优化 Prefill Pool(P芯片)

针对300tokens/s的Decode吞吐优化 Decode Pool(D芯片,类Rubin)

实现极致低时延推理(1000 tokens/s) Decode Pool(L芯片,类LPX)
PRODUCT FORM

为百万级长上下文Prefill而生
最大支持 256卡Scale-Up,构建统一可扩展的PrefillPool,融合高密算力、大容量内存与高带宽互联。面向超长Prompt、RAG、多轮 Agent等场景优化,显著提升长上下文推理效率,降低部署成本,支撑大规模高并发AI应用。

面向高吞吐Decode的推理引擎

为百万级长上下文Prefill而生