96SEO 2026-07-23 23:16 2
这是本系列的第 篇,也是收官篇。
前 篇我们从 GPU 程序结构、CUDA 环境、互联网络讲到训练并行、MoE、RLHF;从推理引擎、PagedAttention、vLLM/SGLang 讲到量化、推测解码、长上下文;从 RAG、向量库、Agent 讲到网关、观测、成本与合规。整整六个大部分,把一个大模型基础设施工程师在 年上半年需要掌握的知识骨架铺了一遍。

但基础设施这件事永远没有"学完"的一刻。年 月 ChatGPT 发布时我们还在讨论"Transformer 推理能不能 batch";两年半后我们在讨论"推理时 Scaling 应该用几棵树""国产千卡集群跑 DeepSeek-V3 的 MFU 能到多少""Blackwell 的 FP4 实战能省多少成本"。下一次大的变盘不会让我们等太久。怎么说呢,
这一篇不讲具体技术实现,而是从一位在工程一线的视角。把未来 – 年可见的演进方向、工程师的成长方法、值得长期追的资源都梳理一遍,给读者一张"接下来往哪走"的路线图。怎么说呢,
全文按"先复盘四年拐点 → 八条趋势 → 工程师方法 → 资源 → 系列索引 → 案例 → 劝退劝进 → "的顺序展开。每一条趋势都尽量给出对基础设施栈的具体影响与可操作的工程建议避免"预测"变成"猜谜"。你可以选择顺读,也可以挑自己最关心的趋势跳读——但十二节的"系列索引"建议留到最终那是系列的完整目录。回看全景时最有用,
先把过去四年的时间轴钉在一张表上,每一个拐点都对应基础设施栈一次大的"翻篇"。
从基础设施栈的角度看。这四年做对了三件事:
之后才程序化的。 B+模型训练进入" $就能做"的阶段。
接下来 – 年的趋势。延续着这三条线索,但在每一条上都会出现新的分叉。
年 月 o1出现之前,业界还在争论“Scaling Law 是不是到头了”。o1给出的答案是:预训练的 Scaling也许放缓了但推理时计算这条轴刚刚开始。 年 DeepSeek-R1、
Qwen QwQ、
Kimi K1.、
Gemini
Thinking、
Claude
Thinking全面跟进,这条范式已经固化。按理说,
典型推理时 Scaling 有三类:
对推理引擎这三类都指向同一件事:**一次“请求”的算力消耗不再可预估**。老实说,一个数学题可能 token出答案。也可能 万 token思考后给答案;一个 Agent任务可能只调一次模型,也可能在树搜索里调 次。
这带来四个基础设施层面的挑战:
2K–1K是常态,单条请求的 KV占用可能比以前一整个 batch还多。长上下文引擎
从“可选调整”变成“必选项”。怎么说呢, reasoningeffort=low|medium|high。或者 maxthinking_tokens=。网关和引擎都要把这个作为一等参数,用于配额、
计费、
SLO。 fork/ RadixAttention。vLLM 的 Prefix Cache、
Outlines 的受约束采样,这些组合在一起才能让 Best-of-N和 MCTS不线性爆炸成本。怎么说呢,2,#8f8f8f7f7f7f7f7f7f7f7f7e34343434343434343434343;910B)上,/PRM 的伪代码,一次 Best-of-N + PRM 的
大致长这样这方面。
async def reason_with_budget :
shared = await
llm.prefill # 前缀共享/params">
branches = await
关键词是 shared prefix batch sampling PRM 并行评分。三件事都要引擎原生支持,否则成本会线性爆炸。
SGLang 原生支持 fork
做并行分支非常自然:
python
import sglang as sgl
@sgl.function def reasonmulti: s += "Question: " + question + " " forks = s.fork for i,f in enumerate: f += f" " f += sgl.gen forks.join s += sgl.gen("final"。maxtokens=128,prompt_suffix="Pick best answer from above: " + " ".join)
配合 RadixAttention,共享前缀的 KV只计算一次
N 条分支的实际成本约为 prefix_cost + N × branch_cost
而不是 N ×——这一点调整对 Best-of-N很关键。
计费模型要改从“按 token收费”过渡到“按 token + 思考预算”双轴。不过,
SLO定义要改TTFT不再是主要指标。TTFA成为新指标,即“使用者从发送到看到最终答案”的墙钟时间。
监控维度要改
:推理链长度分布、
分支选中率、
Verifier命中率都要进
第
¥&euro,§¶,¤«,®¢,±²,³µ,»篇讲的可观测栈。
配额要带维度
:tenant × reasoning_effort双维度配额,防止单租户开 high
把集群打爆。
¥&euro,§¶,¤«,®¢,±²,³µ,»
年 Sora 让视频生成进入“演示级”,¥&euro,§¶,¤«,®¢,按理说,$¡%¦,'(*+,$
年 Veo
¥$
、
Kling
¥$
、
Vidu Q1、可灵、
Pika 进入“可商用级”,$!$
年的关键词是 世界模型
:不只是生成视频,而是生成“
可交互、可预测物理、可被 Agent调用”
的
D世界。老实说,说到代表作,* Genie
/
Genie
$!$,
Google DeepMind,基于图像和动作生成可玩世界。
主流视频/世界模型走 DiT + D VAE + Rectified Flow 说到路线,. D VAE :把 H×W×T 的原始视频压到 h×w×t 的 latent。.Patch 化 + 位置编码 latent 切 patch,加 D RoPE 或 NaViT式变长编码。
写到这里 篇收尾。
四年前我们还在讨论“ GPT- API 怎么接” 四年后我们在讨论“ 千卡集群 MFU 怎么从 % 推到 %""推 单位 token成本怎么从 分钱砍到 厘" 再往后四年。我们大概率会在讨论一些今天还没有名字的东西——也许是“ 世界模型的 PagedAttention” 也许是“ Agent OS 的 cgroup v" 也许是“ 国产 Rubin 的 FP MFU"
这个系列从第 篇开始,一直在重复一个动作:
把一个看起来很大的话题,拆到能动手的粒度 GPU 不神秘,它就是 SM + HBM + NVLink 三样东西的组合;训练不神秘,它就是前向 + 反向 + 通信 + checkpoint 的循环;理不神秘,它就是 prefill + decode + KV 管理 + 调度的流水线;Agent 不神秘,它就是 LLM + 工具 + 状态 + 控制流的状态机。话说回来,所有“新概念”,都是这些基本件的新组合。
三个不会变的判断
四年变化如此剧烈,还有什么是可以确定的?至于我赌三件事,. 算力永远不够用 只要模型能变强。钱就会被投入进去,直到物理极限。怎么说呢,“ 怎么把算力用好” 永远是工程显学。
. * DeepSeek-AI,"DeepSeek-V Technical Report",
. * Kwon et al.,"Efficient Memory Management for Large Language Model Serving with PagedAttention"。SOSP
. * Zheng et al.,"SGLang: Efficient Execution of Structured Language Model Programs",
. * Dao,"FlashAttention- / FlashAttention-",/ . * Gu & Dao,"Mamba / Mamba-",/ .
上一篇 :成本、合规与安全下一篇 返回系列首页
作为专业的SEO优化服务提供商,我们致力于通过科学、系统的搜索引擎优化策略,帮助企业在百度、Google等搜索引擎中获得更高的排名和流量。我们的服务涵盖网站结构优化、内容优化、技术SEO和链接建设等多个维度。
| 服务项目 | 基础套餐 | 标准套餐 | 高级定制 |
|---|---|---|---|
| 关键词优化数量 | 10-20个核心词 | 30-50个核心词+长尾词 | 80-150个全方位覆盖 |
| 内容优化 | 基础页面优化 | 全站内容优化+每月5篇原创 | 个性化内容策略+每月15篇原创 |
| 技术SEO | 基本技术检查 | 全面技术优化+移动适配 | 深度技术重构+性能优化 |
| 外链建设 | 每月5-10条 | 每月20-30条高质量外链 | 每月50+条多渠道外链 |
| 数据报告 | 月度基础报告 | 双周详细报告+分析 | 每周深度报告+策略调整 |
| 效果保障 | 3-6个月见效 | 2-4个月见效 | 1-3个月快速见效 |
我们的SEO优化服务遵循科学严谨的流程,确保每一步都基于数据分析和行业最佳实践:
全面检测网站技术问题、内容质量、竞争对手情况,制定个性化优化方案。
基于用户搜索意图和商业目标,制定全面的关键词矩阵和布局策略。
解决网站技术问题,优化网站结构,提升页面速度和移动端体验。
创作高质量原创内容,优化现有页面,建立内容更新机制。
获取高质量外部链接,建立品牌在线影响力,提升网站权威度。
持续监控排名、流量和转化数据,根据效果调整优化策略。
基于我们服务的客户数据统计,平均优化效果如下:
我们坚信,真正的SEO优化不仅仅是追求排名,而是通过提供优质内容、优化用户体验、建立网站权威,最终实现可持续的业务增长。我们的目标是与客户建立长期合作关系,共同成长。
Demand feedback