2024年的全球算力市场,正上演着一场可能是AI发展史上最剧烈的供给侧分裂,从硅谷到中东,从云服务巨头的集采清单到区域数据中心的二手市场,我们清晰地看到了两道截然不同的风景线:在最顶尖的千亿级参数模型训练和复杂推理场景,高端算力依旧“一卡难求”,稀缺性堪比硬通货;而在海量的模型微调、常规推理及早期AI应用落地层面,中端推理芯片却已步入供给持续宽松,甚至陷入惨烈价格战的去库存周期。

算力市场冰火两重天,顶尖王座一卡难求,中端赛道陷入价格肉搏

这种极度的“冰火两重天”,正在重塑AI产业链的底层逻辑。

高端算力:物理极限与地缘政治铸就的“护城河”

高端算力的定义已经严格收窄至能够流畅承载万亿级以上MoE(混合专家)模型训练,或实现高并发、低延迟复杂思维链推理的加速器集群,以英伟达的H200、B200系列为代表,这类算力构成了通往AGI圣殿的入场券。

高端算力之所以持续紧张,根源在于其不可替代性和极端的供给刚性。

物理定律的锁死,随着制程逼近1纳米以下,单芯片的晶体管密度增长放缓,迫使厂商转向Chiplet(芯粒)和超高带宽存储(HBM3e及以上),这种极度复杂的封装技术,使得产能严重受制于台积电CoWoS-L等先进封装产能,这是一场挤牙膏式的产能释放,根本无法满足谷歌、微软、OpenAI以及中东主权基金动辄“万卡集群,一步到位”的洪水般需求。

政治维度的稀缺性,美国不断升级的出口管制,将算力密度和互连带宽卡死在特定红线内,这造成了合法合规渠道的高端算力在黑市溢价飙升至不可思议的程度,也迫使大型科技企业将数年的资本开支前置,疯狂锁单未来的产能,在这个层级,买方没有任何议价权,拿到货就是核心竞争力。

中端推理:同质化竞争下的“集体踩踏”

与顶端的稀缺形成荒谬对比的,是中端推理芯片市场的过度拥挤和供给泛滥,这里所说的“中端”,指的是那些足以运行7B到70B参数开源模型,满足图文生成、基础对话和简单代码生成的各类ASIC、GPU和AI加速卡。

这轮供给宽松,是技术民主化与资本狂热的双重副产品。

开源模型的极致瘦身催生了巨大的需求幻觉,通过量化、剪枝和蒸馏技术,原本需要高端卡运行的模型被“压缩”至中端卡可承载的范围,市场一度认为,随着AI应用在边缘端和设备端的爆发,中端推理芯片将迎来指数级增长,传统的芯片厂商、初创独角兽,乃至云厂商自研的推理芯片,都在这一赛道疯狂堆料,试图用低价换份额。

现实是推理端出现了“算力通胀”的消退。 软件生态的护城河远比想象中深厚,尽管许多中端卡在纸面算力和功耗比上表现亮眼,但CUDA生态数十年的积累如同重力一般,让移植和适配成本高得惊人,许多企业在尝试切换后发现,省下的硬件成本远不足以覆盖高昂的软件重建和调试时间。

巨头的降维打击直接封死了中端卡的溢价空间,头部云厂商大量采购高端卡,在非高峰时段将闲置算力切片、降价倾销用于推理任务,这种“高端算力做中端活”的错位竞争,让纯中端芯片的生存土壤急剧盐碱化,供给持续涌入,但杀手级应用的推理需求并未如预期那般散射开来,导致渠道库存高企,一批AI芯片初创公司尚未盈利就已站在了悬崖边上。

算力阶级的固化与重构

这种分裂的延续,将导致AI产业出现明显的“算力阶级分化”。

拥有高端算力集群的玩家,将持续突破智能边界,通过合成数据、自我博弈等方式构建更强大的模型,形成技术代差的马太效应,他们将垄断最顶尖的AI服务定价权。

困守在中端推理芯片冗余供给中的企业,则必须放弃幻想,转而深耕极致性价比,胜出的机会在于“存算一体”、“基于特定场景的软硬件全栈优化”,甚至是将大模型进一步剪裁至可以在PC和手机端侧运行的规格,彻底摆脱对云端推理价格的依赖。

对于投资者和从业者而言,认清这一“冰火”现实至关重要,在高端领域,必须不计成本地储备弹药;在中端领域,则要警惕那些仅靠纸面参数和国产替代概念、却无实质性软件生态粘性的项目,当潮水退去,高端算力依然是这个时代最硬的硬通货,而中端市场的大洗牌,或许才刚刚开始。