我们亲眼见证了,中国AI正在经历一场从应用套壳向物理硬核的质变。而这其中最重要的节点,或许是DeepSeek给了国产大模型信心,证明了算力问题不是无法克服的障碍。

  原创ⓒ科技新知 AI新科技组

  作者丨凤梨 编辑丨九黎

  当Kimi发布2.8万亿级开源模型K3时,整个科技圈都在经历一场强烈的认知冲击。

  硅谷研究员惊讶的地方在于:中国这些AI公司,算力不如别人,用户付费意愿不如别人,怎么能做到这种地步?

  华尔街惊讶的地方在于:我在美股这么多年,花了这么多钱,养了这么多人,现在你跟我说300亿就能把事办了?

  这不仅是一次开源社区的技术跑分胜利,更是对硅谷既定AI叙事的一记正面重击。

  01

  算法亮剑:击穿AI登月的全球收租美梦

  过去一年,OpenAI与Anthropic等头部玩家用海量算力筑起了极高的闭源API护城河,确立了全球顶级AI能力的定价权。

  在这个充满科技理想主义色彩的AI登月神话背后,本质上是一场极具排他性的全球收租计划。欧美巨头们试图通过极高的算力资金门槛与庞大的算力集群工程壁垒,在技术顶层筑起一个密不透风的黑盒。

  在这个商业闭环中,全球的广大中小型企业、垂直行业开发者乃至二次创业的软件团队,都被强制内化为闭源API接口下游的数字打工仔。高昂的单位Token调用成本、完全不透明的底层权重,以及随时可能被上游模型版本更迭直接降维打击的平台锁死风险,成为了压在全球广大开发者头顶的三座大山。这种商业模式非但没有让AI技术真正普惠,反而扼杀了大量本可以生长在应用层的微创新。

  面对先进芯片获取受限、超大集群建设成本高企的客观现实,中国AI企业无法盲目复刻十万张H100暴力堆砌的路线,而是走上了极限工程优化的道路。K3在特定维度的开源登顶,证明了通过MoE架构优化与高质量数据清洗,完全可以在部分场景实现对标。

  以K3 2.8万亿参数的体量为例,单纯的稠密模型在每次推理时需要激活所有参数,这在算力受限的环境下是不可承受之重。而K3通过高度优化的动态路由机制,能够确保在处理每一个具体的推理任务时,仅激活全网中极小比例的相关专家网络。这意味着在同等甚至更优的推理表现下,模型的运算显存占用与动态计算开销被直接砍掉了数个数量级。这种对算法架构的极致瘦身,让原本只有顶级土豪才能运行的庞然大物,变得可以在有限规模的算力集群上高效运转。

  与此同时,中国AI产业在高熵高质量数据清洗与合成数据飞轮领域的理解,已经从初期的粗放爬取迈入了精密制造阶段。在这一进程中,诸如硅基流动、无问芯穹等基础设施建设者,正通过异构集群调度与推理加速,把大模型的落地成本打到极致。大模型的全生命周期中,训练仅仅占据一次性的固定成本,而模型上线后的推理部署才是无休止的消耗战。国产Infra玩家通过深度重构底层推理引擎,广泛普及vLLM投机采样、PagedAttention显存管理机制,以及对低比特量化技术的无损落地,硬生生将大模型的单次推理落地成本打到了物理极限水平。他们甚至做到了将不同品牌、不同代际的计算芯片池化调度,榨干了每一滴闲置算力。

  中国开源生态的繁荣,正以极高的性价比分流全球中长尾开发者,从应用端倒逼闭源巨头让出高昂的溢价空间。当一个来自中国的开源模型能以极低的成本完成同样的工作,全球大模型产业的付费底座正在发生不可逆转的倾斜。

  02

  认知突围:用慢思考碾碎闭源高昂溢价

  K3的冲锋只是反击序章。真正决定这场科技战终局的,是即将到来的国产Fable级模型。

  在大模型产业发展的最初阶段,全球技术赛场被简化为一场,关于预训练参数规模的单向竞赛。然而,随着Scaling Law在纯无监督预训练阶段逐步触及高质量人类语料库枯竭以及算力转换效率的拐点,整个行业的共识正在迅速转向:真正的认知智力突破,不再来源于盲目扩充通用数据的参数体量,而是决胜于强化学习与针对复杂问题的推理时间扩展。这意味着模型能力必须从基于直觉的快思考模式,向深入剖析、多步推演的慢思考深水区挺进,以此重新洗牌高级智能认知的定价权。

  K3发布后的一个月,中国AI迎来了史诗级的火力覆盖:以阿里重磅发布拥有2.4万亿参数的Qwen3.8为标志,配合DeepSeek在R系列架构上对推理成本的颠覆性下探,以及智谱GLM、MiniMax在长序列逻辑上的持续演进,国产大模型正在撕掉套壳标签,堂堂正正地站在了全球前沿技术角力的最前线。

  尽管在超长视频生成与原生多模态底层上,中美仍有客观的时间代差,但在极度考验强化学习与合成数据质量的推理平权赛道,中国头部独角兽如月之暗面、百川智能、阶跃星辰等正在迅速缩小差距。在原生视频生成、高动态物理世界模拟等领域,底层扩散架构与大规模多模态预训练依然依赖庞大的基础算力底座,这其中的代差必须被正视。

  然而,在当前商业化最迫切的逻辑验证赛道,绝对算力的垄断正在失效。在这种极度考验奖励模型精细度与蒙特卡洛搜索树推理优化的角斗场里,拥有反思能力与自我纠错的慢思考模型,正在拉平由于基础显卡集群数量不同而造成的表层差距。当模型遇到复杂问题时,不再是立刻给出一个似是而非的预测,而是学会在后台自行拆解步骤、验证对错、推翻重来。

  一旦这些企业在高级推理能力上取得结构性突破,并将单位Token成本打穿,B端Agent商业化落地的最大阻碍将被彻底扫除。长久以来,海外闭源巨头的护城河就在于高端复杂的长链条逻辑推理能力,并借此收取令人咋舌的费用。

  一旦中国大模型企业能够将该级别智力的单次消耗成本压缩至海外对手的十分之一甚至百分之一,欧美巨头在高级认知智力上仅存的高昂溢价将被彻底碾碎。这种平权化正是全球B端Agent爆发的唯一前提。复杂的业务流自动化需要系统进行多步骤的规划、工具调用与试错回调,如果推理成本居高不下且出错率高,企业部署AI的投资回报率必为负数。中国AI企业通过打穿高阶推理成本,等于为全球企业级数字员工铺设了一条廉价且无限供给的高速公路,让AI真正深刻、丝滑地嵌进最严苛的业务流程底层。

  03

  底层重构:用全栈国产打赢最后一战

  然而,没有物理底座的支撑,绝顶的算法奇迹终究只是空中楼阁。

  从业者都很清楚:国内绝大多数AI企业的繁荣,现阶段仍离不开海外芯片与国产算力的混合支撑。时至今日,在底层硬件集群的构建上,国内头部企业依然极大地依赖于存量合规海外高端GPU与国产半导体算卡混合部署的过渡态异构架构。在极端的外部技术封锁与层层加码的出口管制背景下,当既有的海外存量硬件寿终正寝,当向下一代百亿级、十万卡级别集群调度需求无可回避时,如果本土产业链无法完成真正物理底座的彻底替代,中国AI产业的整栋摩天大楼将始终面临被一键抽走基石的致命风险。这是一场没有退路、更没有捷径可走的跨世纪战役。

  在AI算力的庞大系统中,HBM和底层软件生态是真正的阿喀琉斯之踵。全栈国产化的破局,没有一夜逆袭的神话,只有极其悲壮的结硬寨、打呆仗。我们要解决的不仅是单卡算力,更是良率爬坡、先进封装以及异构互联的全面突围。

  在大模型时代,系统遭遇的根本物理瓶颈不仅是在算得够不够快,而更致命的是在内存带宽够不够宽。参数加载与推理计算就像是用极细的吸水管去吸取巨大的水库,这就要求底层存储必须采用将多个DRAM裸片垂直堆叠并依靠硅通孔微米级互联的HBM技术。重构HBM与先进封装链条的艰辛,丝毫不亚于在荒漠深处徒手重建特高压电网。我们面对的是从先进半导体材料、纳米级封装工艺,到内存颗粒堆叠过程中的极端良率爬坡、严重的散热控制,直到集群互联通信协议的高速无损传输。

  这最难的一步,恰恰是最没有捷径的一步。长鑫存储在HBM量产与良率上的死磕,以及华为昇腾、壁仞、燧原等国产GPU在各自独立软件栈如CANN等上一行行调算子、做生态适配的血泪攻坚,揭示了底层重构的残酷真相:我们面对的不是一个现成的国产CUDA,而是一套需要从荒漠中徒手建立的特高压电网。

  英伟达的坚不可摧并非仅靠芯片,而是二十年来近数百万开发者通过行行代码写就的CUDA闭源软件体系。面对这堵高墙,中国异质芯片产业高度分散。国内的系统架构师和底层工程师必须抛弃舒适区,深入硬件指令集底层,手把手重新手写算子、深度定制内存分配架构、一行行调优分布式通信原语。将报错频繁的本土软硬件栈,一步步打磨到工业水准,这是一个需要全行业共同忍受数年寂寞的生死天险。

  所有在这个领域流下的血与汗,都有着极其深刻的时代底色。各大国产GPU独角兽企业在生态适配上的日夜攻坚,本质上是在替中国的整个互联网与数字经济底座,彻底拔除埋藏数十年的卡脖子暗雷。

  随着国产半导体在HBM良率上的逐步稳定、以及国产异构芯片在基础软件栈上的长期汇聚,中国AI底座在物理层面实现安全循环的拐点必将到来。

  上层的工程极限压缩、中层的推理平权突围、底层的硬件血泪攻坚,这三者构成了中国AI最真实的产业切面。

  在这场科技角力中,中国科技产业最迷人的地方不在于编织宏大叙事,而在于极其强悍的韧性:哪怕开局受制于人,我们也能在极端的约束条件下,一砖一瓦拼凑出属于自己的算力底座。资本市场的目光,也终将穿透浮躁的应用层泡沫,向这批真正啃硬骨头的硬核卖水人致敬。