2026世界人工智能大会(WAIC)期间,中昊芯英主办的“智算跃迁 芯有新篇——专用算力时代下TPU的创新与共进”分论坛在上海世博中心举行。会上,中昊芯英新一代全自研TPU架构AI专用算力芯片“须臾®”首次面向产业界公开展示,华东地区首个国产TPU千卡智算集群正式落成,两场全域生态合作签约完成。
从芯片架构迭代到规模化集群验证,再到全产业链生态共建,坚持TPU专用算力路线的中昊芯英,正推动国产AI算力从“可用”向“好用、高性价比、全生态适配”进阶。

算力性能跃升3倍,全栈自研筑牢自主可控底座
作为继初代“刹那®”之后的全新架构产品,“须臾®”芯片基于第一代芯片市场化落地的真实业务反馈完成底层重构,核心性能实现跨越式升级。官方数据显示,单颗“须臾®”芯片混合精度浮点算力达896TFLOPS,性能为上一代产品的3倍;8-bit推理算力可达1792TOPS,适配海量Token高并发推理场景;单芯片额定功耗600W,相较同等算力水平的传统算力芯片功耗降低50%,契合绿色低碳智算中心建设需求。
性能的大幅跃升得益于计算、封装、存储三重架构的创新协同。中昊芯英联合创始人、CTO郑瀚寻介绍,二代芯片全程贯彻“软件驱动硬件架构”的设计思路:一方面重构矩阵计算核心单元与低精度计算模块,提升基础算子执行效率;另一方面采用双芯粒同基板封装方案,搭配自研低延迟片间互联通道,实现两颗芯粒协同并行运算,释放双倍算力;同时扩容片上高速存储容量与读写带宽,减少跨芯片数据搬运带来的算力损耗。三重创新叠加之下,芯片综合性能提升3倍,整体功耗未出现明显上涨。
自主可控是国产算力芯片的核心准入门槛,也是中昊芯英TPU技术路线的核心优势之一。中昊芯英创始人、CEO杨龚轶凡表示,从芯片硬件底层到上层服务API,“须臾®”芯片国产化自研程度处于国内第一梯队,完整满足政企全场景国产化采购要求。具体来看,芯片核心逻辑层实现100%全自研,整套专属指令集群、全部底层IP均从0到1独立设计,无第三方逻辑IP采购;生产制造环节实现国产化落地;软件链路同样全栈自主开发,从底层固件、驱动、算子库到深度学习框架适配、标准化API交付,整条链路无海外闭源软件依赖,完整实现全链路自主可控。
千卡集群落地验证商用能力,系统级优化重构算力成本
本次WAIC期间,华东地区(杭州)首个国产TPU智算千卡集群正式落成。该集群由杭州电信、中兴通讯与中昊芯英联合打造,基于中昊芯英“泰则®”智算平台构建,面向大模型训练、AI推理、科学计算等场景提供全自主算力支撑。

在行业全面迈向集群化的趋势下,TPU架构的先天优势进一步凸显。与GPU早年面向单卡图形渲染不同,TPU从立项之初就面向大规模深度学习、分布式并行运算打造,天然适配万卡级别超节点集群搭建。
据杨龚轶凡介绍,中昊芯英采用3D Torus拓扑结构的自研互联方案,专门针对上百颗芯片同步并行、高密度并发通信的场景设计,大规模集群环境下通信延迟更低、运算性价比更高。目前,中昊芯英TPU芯片可无缝适配国内主流整机厂商的超节点硬件方案,支持混合算力集群部署。
成本优势是国产算力替代的核心竞争力,也是智算中心商业化运营的关键指标。杨龚轶凡透露,同等算力输出规模下,不计机房电费与运维成本,“须臾®”集群的硬件采购成本仅为上一代集群的1/2至1/3;直接部署二代芯片,企业综合运营成本降低50%。结合当前算力租赁报价、硬件采购与运维成本,完整超节点智算中心项目的投资回本周期约三年。
随着Token经济与AI智能体爆发,算力需求呈现输入输出不均衡特征,Prefill-Decode分离调度(PD分离)成为刚需。传统GPU需大量上层软件改造方能实现PD分离,而中昊芯英TPU底层架构原生适配,落地门槛更低、调度效率更高。
TPU技术迭代助力国产算力全链路替代,撬动万亿产业空间
当前,国产算力替代进入深水区,全栈自主可控的TPU路线价值不止于供应链替代,更在于从底层重构AI算力成本曲线,撬动万亿级AI产业落地。
杨龚轶凡指出,大量实测验证,同等生产制程、同等芯片面积、同等硬件采购成本下,TPU架构运行大模型Prefill、Decode任务速度更快、单位算力能耗更低、综合使用成本更低,对比通用GPU具备天然架构优势,且会随着大模型商业化持续落地不断放大。他表示,中昊芯英的长期目标是推动TPU成为AI算力领域通用主流架构,对标通用计算领域X86架构的行业地位,构建国内自主可控的TPU完整算力生态。
具体来看,TPU路线的产业价值体现在三个维度:
其一,持续降低全行业算力使用成本。每一代TPU芯片迭代可实现2-4倍综合性价比提升,持续拉低大模型训练、推理的单位Token算力开销。当前AI智能体场景算力成本高企,海外同类产品单用户每日算力开销达5-10美金,制约了智能体的商业化普及。若依托国产TPU将单日算力成本压缩至0.5美金,大量中小企业与普通用户将具备规模化使用AI智能体的能力,加速AI向全社会生产力渗透。
其二,实现国产算力全链路自主替代。目前国内尚无算力芯片厂商可独立完成超大参数大模型从训练到推理的全链路国产化部署,仍需依赖海外高端GPU辅助。而随着TPU产品的持续迭代,中长期有望实现全链路国产算力闭环,彻底摆脱对海外高端算力芯片的依赖。
其三,加速万亿级AI产业落地普及。算力成本持续下行叠加全栈自主可控,将推动各行各业低成本部署专属大模型与智能体应用,让AI从互联网行业专属工具转变为全行业通用生产力底座,释放万亿级AI市场空间。
市场高估AI芯片落地节奏,低估了架构创新的长期价值
当前,资本市场对AI芯片的国产替代进度和业绩释放节奏均有较高预期。在杨龚轶凡看来,市场普遍高估了AI芯片的落地速度,现实中一款全新AI芯片从架构仿真到规模化商用的完整周期需5至6年,配套软件栈达到成熟水平也需3至5年。同时,市场普遍低估了底层硬件架构创新形成的长期壁垒,当前架构差异化带来的性价比红利尚未充分释放,未来这将成为企业拉开差距的核心。
“可持续迭代的自研硬件架构、成熟完善的全栈软件生态、稳定可控的供应链量产交付能力和覆盖全行业客户的落地服务体系,这四方面是决定算力芯片企业长期竞争力的核心要素。”杨龚轶凡表示。
从市场空间来看,杨龚轶凡认为算力赛道需求远未见顶,国内算力硬件采购规模每年保持2-3倍的高速增长,市场空间充足。当前行业面临的考验集中于两点:一是打磨成熟易用的软件栈与配套产业生态,二是持续迭代芯片产品,实现先进制程下的稳定量产与按时交付。
对中昊芯英而言,随着“须臾®”公开亮相、千卡集群落地、生态版图扩容,TPU专用算力路线的长期价值正逐步兑现,也为国产AI算力自主发展提供了差异化技术路径与商业样本。
炒股配资提示:文章来自网络,不代表本站观点。