这篇回答两个问题:训练和推理为什么对芯片的要求不同,这个差异又怎么解释内存价格的上涨?
先说清楚:训练和推理是什么
如果你直接从这篇开始读,先用一分钟建立基础认知。
训练,是让模型从数据里学习的过程。给模型喂几千亿个词、几十亿张图,让它反复调整内部参数,直到能准确预测下一个词、识别图里的内容。这个过程计算量极大,通常要跑几周甚至几个月,用的是数据中心里几百上千块 GPU 组成的集群。
推理,是用训练好的模型回答问题的过程。你在 ChatGPT 或者 Claude 里发一条消息,背后就是推理:模型接收你的输入,一个词一个词地生成回答。这个过程计算量比训练小得多,但对速度要求极高——没有人愿意等三十秒才收到回复。
一个粗糙但有用的类比:训练像备考,可以慢慢来,错了重来,目标是把知识装进脑子;推理像考试,必须在规定时间内作答,慢了就扣分。备考和考试需要的东西不完全一样,训练和推理对芯片的需求,有类似的差异。
训练在意什么:吞吐量
训练的核心操作是矩阵乘法——把大量数字组成的矩阵反复相乘、迭代更新。这是一种极其适合并行处理的计算:几百亿次运算可以拆成很多小块同时跑,每一块之间基本互不依赖。
在这个场景下,芯片最重要的指标是吞吐量:单位时间内能完成多少次浮点运算。速度不够快不是灾难,慢就是慢,训练多跑几天而已。精度要求也比较高——训练时参数的细微差异会累积影响最终效果,通常用 FP16 或 BF16 这类较高精度的浮点格式。
GPU 非常适合训练:它有几千个小核心同时工作,天然擅长大规模并行计算。英伟达的 H100、H200,就是在这个方向上做到极致的芯片。
推理在意什么:延迟和内存带宽
推理的情况完全不同。
模型生成回答的方式,是一个词一个词地往后预测:先生成第一个词,再基于第一个词生成第二个词,再基于前两个词生成第三个词……这个过程是严格串行的,没办法像训练那样拆成很多块同时跑。
这带来两个核心需求:
第一是低延迟。每生成一个词都要等上一个词完成,串行结构决定了单步速度直接影响用户体验。芯片能多快完成一次运算,比总吞吐量更重要。
第二是内存带宽。模型在生成每个词的时候,需要把之前所有词的上下文状态从内存里读出来参考——上下文越长、同时服务的用户越多,需要频繁读写的数据量就越大。这时候决定速度的不是计算能力,而是内存能多快把数据传给芯片。
GPU 做推理完全可以,英伟达的 H100 每天都在跑推理服务。但 GPU 的设计重心是吞吐量,在推理所需的低延迟和高内存带宽上并不是最优解。这个差距在推理量小的时候感知不强,但当服务规模扩大、每天要处理几百亿次用户请求时,效率的差异会被放大成真实的成本压力。
需求差异,开始在产品上留下痕迹
推理规模爆发之前,GPU 同时做训练和推理是这个行业的默认选择——早期推理量不大,专门为推理优化一套芯片,不太划算。但随着推理需求持续增长,这笔账开始算不过来了。
一个具体的例子是华为昇腾的产品路线。华为正在把训练和推理分成两条独立的芯片线:昇腾 950PR 是推理专用芯片,针对低延迟和高内存带宽优化,2026 年 3 月正式量产;昇腾 950DT 是训练专用芯片,预期 2026 年第四季度推出。同一家公司、同一个系列,专门拆成两条线来做,本身说明两种需求的差异大到值得用独立的产品来应对。
DeepSeek V4 在 2026 年 4 月发布时,选择了昇腾 950PR 作为主力推理硬件。这个决定有供应链背景——英伟达高端芯片受出口管制,国产替代是现实压力下的选择。但抛开这层背景,昇腾 950PR 也确实符合推理场景的需求逻辑:它是目前国内唯一已商用且明确支持 FP4 低精度推理的芯片。所谓低精度,是指推理时不需要训练阶段那么精确的数值格式,用更少的位数表示权重,换来更高的内存利用效率和更低的单次请求成本。
值得说清楚的是:DeepSeek 的训练阶段仍然依赖英伟达的 GPU 和 CUDA 生态,推理才迁移到昇腾。训练和推理用不同芯片,不是某种新奇的架构创新,而是两种需求分开处理的自然结果。
推理规模化,如何传导到内存价格
理解了推理对内存带宽的依赖,就能理解 HBM 为什么变得如此重要。
HBM(高带宽内存,High Bandwidth Memory)是一种专门焊在 GPU 和 AI 芯片上的高性能内存,通过三维堆叠的方式实现极高的内存带宽,正是推理场景最需要的那个指标。英伟达 H100 上装的是 HBM3,每块 80GB,带宽远超普通内存。
推理服务和训练任务有一个关键区别:训练是项目制的(一个模型训完了可以暂停,下一个版本开始再重新启动),本质上是间歇性需求;推理是服务制的,只要产品在运行服务就要持续跑,HBM 就要持续被占用。随着大模型用户数量爆发,全球数据中心里跑推理的芯片越来越多,对 HBM 的需求从间歇性变成了持续性。
SK 海力士是全球最大的 HBM 供应商,据 Counterpoint Research 数据,2025 年第二季度市占率约为 62%,是英伟达 H100、H200 系列最主要的内存供应商。HBM 需求的爆发直接反映在了财务数据上:据 SK 海力士官方财报,2025 年全年 HBM 收入同比翻倍以上,全年营业利润达 47.2 万亿韩元,同比增长约 101%,创历史新高。SK 海力士在这份财报中也写道(译自英文原文):"AI 市场正在从训练向推理转型,随着对分布式架构需求的扩大,内存的作用将变得越来越关键。"
HBM 的需求溢出,还带来了一个间接影响:HBM 和普通消费级内存(DDR4/DDR5)的生产工艺有重叠。当内存厂商把大量产能转向利润更高的 HBM,消费级内存的供给就相应收紧,价格跟着上涨。两者不是同一个东西,但共用了部分产能——这是 AI 算力需求传导到消费市场的路径。Counterpoint Research 分析师在 2026 年一季度也指出(译自英文原文):"推理所需的内存远超预期,各公司争相确保供应。"
这条链条,现在还在运转
从训练和推理的计算特征差异,到专用芯片开始出现,到 HBM 持续短缺,到普通内存价格上涨,这是一条比较长的因果链,但每一步都有实际的逻辑支撑。
说实话,我最初关注这个问题的时候,没想到内存涨价和推理需求之间的联系会这么直接。通常人们谈 AI 对硬件的影响,说的是 GPU 供不应求,内存只是个配角。但从这条链条来看,内存才是推理规模化最先触到天花板的地方。
目前有几件事还不确定:HBM 的供给会不会在未来几年赶上需求(三星正在追赶,美光也在扩产);推理专用芯片的方向是否会成为主流,还是 GPU 凭借软件生态继续统治全场;消费级内存的价格还会涨多久。
这些问题现在没有确定的答案。但有一件事,从这条链条来看比较清晰:推理,正在成为 AI 基础设施里的主角,而不再只是训练的附属品。
参考资料
- SK hynix Announces FY25 Financial Results
- SK hynix Q1 2026 Earnings: AI Memory Shortage Drives Record Profit
- SK hynix holds 62% of HBM, Micron overtakes Samsung
- DeepSeek V4 发布,昇腾950PR 成主力推理硬件
- DeepSeek V4 全面换装华为昇腾950PR
- DeepSeek+华为昇腾全国产AI生态突围
- Why Micron and SK Hynix Could Quietly Become the Real AI Winners