96SEO 2026-08-02 14:50 2
话说回来,
这篇文章用 「春眠不觉」→ 补全「晓」 走通 Transformer 从输入到输出的完整链路。文首流程图用字符输入演示各步;后文示例多用整句 「春眠不觉晓」。示例模型为 uer/gpt2-chinese-cluecorpussmall。
痛点:看到一堆术语却不知道它们在实际推理中是怎么衔接的?说起来,下面用「春眠不觉」→补全「晓」串起全流程。帮助你把抽象框架映射到每一步的真实操作。不过,

再看输入,"春眠不觉"
│
▼
┌─────────────────────────────────────────┐
│ . Tokenize │
│ │
└─────────────────────────────────────────┘
│
▼
┌─────────────────────────────────────────┐
│ . 编码 │
│ │ ← 示例 ID
└─────────────────────────────────────────┘
│
▼
┌─────────────────────────────────────────┐
│ . Embedding │
│ 查表得 │
└─────────────────────────────────────────┘
│
▼
┌─────────────────────────────────────────┐
│ . 位置编码 │
│ 与 vi 相加:输入i = vi + pi │
└─────────────────────────────────────────┘
│
▼
┌─────────────────────────────────────────┐
│ . Decoder × N 层│
│ • Masked Self-Attention │
│ • Feed-Forward Network │
│ • 残差连接 + LayerNorm │
│ (Encoder‑Decoder 架构才有 Cross‑Attention。│
│ 纯 GPT 无此项) │
└─────────────────────────────────────────┘
│
▼
┌─────────────────────────────────────────┐
│ . Linear │
│ 隐状态 → 词表大小 → logits│
└─────────────────────────────────────────┘>
▼
┌─────────────────────────────────────────┐
| . Softmax |
| logits → 词表上的概率分布 |
└─────────────────────────────────────────┘
▼
说到概率示意,→ 「晓」对应下标概率最高
▼
输出 Token:"晓"
至于最终句子,"春眠不觉晓"
后文各节按 → 的顺序展开说明。
痛点:很多人卡在「为什么要把文字切成 token?」还有「不同模型的分词方式有什么区别?」这里给出直观答案,
Transformer 第一步先必须把文字变成数字序列。模型只能做矩阵运算,不能直接处理汉字或英文。
对应上文流程图的第1、2步,由 Tokenizer 完成:
| 人类视角 | 模型视角 | |
|---|---|---|
| 输入「春眠不觉晓」后得到的 Token ID 序列 |
送进模型的是 ID 序列不是原始字符串。 分词器主要两件事:
注意:
| 粒度 | 做法 | 优点 | 缺点 |
|---|---|---|---|
| 字/字符级 | 每个汉字/英文字母单独成 Token | 词表小、罕见字符也能表示;序列更长 语义被拆碎 | - |
| 词级 | 直观、易解释 | 词表巨大。OOV 难处理 | |
| 子词级 BPE / WordPiece / SentencePiece 等 | 可控大小的混合切分 | 兼顾常见与生僻词 | 实现稍复杂,需要专门学习 |
当前主流大模型几乎都采用子词分词**:常见词保留完整,生僻词拆成更小片段。
从原文来看,"春眠不觉晓"
Token 化后:
对应 ID:
解码时再使用 tokenizer 的 .decode` 将 ID 转回文字。
| 符号 | 常见含义或用途 | |
|---|---|---|
| BERT 等用于分类/句首聚合 | ||
| BERT 双句输入时的分隔符 | ||
| 填充到统一长度 | ||
| 掩码语言模型训练时遮盖的位置 | ||
| GPT 类生成结束标记 |
| 维度 | 含义 | |
|---|---|---|
| 0 | batch size | |
| 1 | seq_len | |
| 2 | hidden_size |
The plain embedding ignores order — “狗咬人” 与 “人咬狗” 会得到相同向量集合。我们通过加入位置向量来弥补这一缺陷。
| 方式 | 说明 | |
|---|---|---|
| 正弦位置编码 | 固定函数。不增参数 | |
| 可学习位置编码 | 每个位置都有可训练向量 |
# GPT‑style 可学习位置编码已经内置于 forward 中
from transformers import AutoModel。AutoTokenizer
model_name ="uer/gpt2-chinese-cluecorpussmall"
tokenizer =AutoTokenizer.from_pretrained
model =AutoModel.from_pretrained
inputs =tokenizer
outputs =model # 自动完成 wte + wpe 相加
print #
-
”,Position Embedding 捕捉“在哪”。
-
没有位置信息,self‑attention 无法区分前后顺序。
作为专业的SEO优化服务提供商,我们致力于通过科学、系统的搜索引擎优化策略,帮助企业在百度、Google等搜索引擎中获得更高的排名和流量。我们的服务涵盖网站结构优化、内容优化、技术SEO和链接建设等多个维度。
| 服务项目 | 基础套餐 | 标准套餐 | 高级定制 |
|---|---|---|---|
| 关键词优化数量 | 10-20个核心词 | 30-50个核心词+长尾词 | 80-150个全方位覆盖 |
| 内容优化 | 基础页面优化 | 全站内容优化+每月5篇原创 | 个性化内容策略+每月15篇原创 |
| 技术SEO | 基本技术检查 | 全面技术优化+移动适配 | 深度技术重构+性能优化 |
| 外链建设 | 每月5-10条 | 每月20-30条高质量外链 | 每月50+条多渠道外链 |
| 数据报告 | 月度基础报告 | 双周详细报告+分析 | 每周深度报告+策略调整 |
| 效果保障 | 3-6个月见效 | 2-4个月见效 | 1-3个月快速见效 |
我们的SEO优化服务遵循科学严谨的流程,确保每一步都基于数据分析和行业最佳实践:
全面检测网站技术问题、内容质量、竞争对手情况,制定个性化优化方案。
基于用户搜索意图和商业目标,制定全面的关键词矩阵和布局策略。
解决网站技术问题,优化网站结构,提升页面速度和移动端体验。
创作高质量原创内容,优化现有页面,建立内容更新机制。
获取高质量外部链接,建立品牌在线影响力,提升网站权威度。
持续监控排名、流量和转化数据,根据效果调整优化策略。
基于我们服务的客户数据统计,平均优化效果如下:
我们坚信,真正的SEO优化不仅仅是追求排名,而是通过提供优质内容、优化用户体验、建立网站权威,最终实现可持续的业务增长。我们的目标是与客户建立长期合作关系,共同成长。
Demand feedback