96SEO 2026-09-08 19:31 3
在前文我们讨论了分词器如何将一句话拆成子词并映射为 token id 序列,但这些编号本身并不携带任何语义或顺序信息。这篇文章聚焦于 token id 之后的两步关键:先通过嵌入层把离散编号转换为稠密向量。再将位置信息注入,最终进入 Transformer 层。了解这两步是解决大模型推理中“为什么同一组词在不同句子里表现完全不同”的主要痛点。
嵌入是把离散的 token id 映射为连续向量的过程。它的实现非常直观:一个形状为 vocab_size × hidden_size 的二维矩阵,每一行对应词表里一个 token 的向量。token id 进来后按行号直接取出对应那一行。完成查表,无需任何复杂运算。

以 Qwen3‑0.6B 为例。其 vocab_size 为 49152,隐藏层维度是 4096,所以嵌入矩阵是一个 49152 行、4096 列的浮点数表格。每个 token 被表示成一个 4096 维的稠密向量——所有维度都是实数,没有大量零元素。
这张表是在训练过程中和模型其他参数一起学出来的。已知相近语义的词在空间中也相近,例如 “king - man + woman ≈ queen”。这说明向量里编码了性别、王室身份等语义维度,词与词的关系可以通过向量加减实现。
大模型词表里的单位是子词,而不是完整单词。例如 “unbelief” 会被拆成 “un”和“belief”,各自有自己的向量。现代模型依赖后续层将子词组合成完整单词的语义。
下面用 Hugging Face transformers 加载 Qwen/Qwen3‑0.6B 并查看其嵌入层:
import torch
from transformers import AutoModelForCausalLM
model_name = "Qwen/Qwen3-0.6B"
model = AutoModelForCausalLM.from_pretrained
emb = model.get_input_embeddings
print
至于输出。
torch.Size
再验证一下语义性:计算两个单个 token 的余弦相似度:
import torch.nn.functional as F
from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained
def vec:
token_id = tokenizer.encode
return emb.weight
pairs =
for a,b in pairs:
sim = F.cosine_similarity,vec,dim=0)
从print来看,.4f}")
输出示例的观点是,
猫 vs 狗: 0.8125
猫 vs 汽车: 0.3217
虽然嵌入向量解决了语义问题,却仍然缺少顺序信息。Transformer 主要是。它对一批向量做点积计算,只关注集合而不关心先后顺序。说起来,打乱输入顺序,只要仍是同一组向量,输出结果就保持不变。这种性质叫置换等变,它导致“狗咬人”和“人咬狗”在注意力视角下完全等价——显然这是错误的。
下面用 NumPy 验证注意力对顺序无感知:
import numpy as np
rng = np.random.default_rng
d = 64
Wq,Wk,Wv = ) for _ in range)
def attention:
q,k,v = x @ Wq,x @ Wk。x @ Wv
scores = q @ k.T / np.sqrt
scores = np.exp)
weights = scores / scores.sum
return weights @ v
x = rng.normal) # 四个 token
out1 = attention
perm = np.array # 打乱顺序
out2 = attention
inv_perm = np.argsort
print.max:.2e}")
打乱前后的最大差异: 8.12e-16
| 比较项 | \t正弦绝对定位 | \tRoPE | \t典型使用者 | \t备注 | \t\t\t\t\t\t \t\t \t
|---|---|---|---|---|
| 作用对象 \t | 加在嵌入 | 旋转 query/key | 原始 Transformer | 无额外参数 |
| 类型 \t | 绝对定位 | 内积自然体现相对定位 | Qwen/Llama/DeepSeek/Gemma 等 | |
| 可学习参数 \t | 无 | 无 | ||
| 语义与位置信息混杂吗?不过,\t | 混杂 | 分离清晰 | ||
| \tnote=\"\"\">none \tnote=\"\"\">none | ||||
作为专业的SEO优化服务提供商,我们致力于通过科学、系统的搜索引擎优化策略,帮助企业在百度、Google等搜索引擎中获得更高的排名和流量。我们的服务涵盖网站结构优化、内容优化、技术SEO和链接建设等多个维度。
| 服务项目 | 基础套餐 | 标准套餐 | 高级定制 |
|---|---|---|---|
| 关键词优化数量 | 10-20个核心词 | 30-50个核心词+长尾词 | 80-150个全方位覆盖 |
| 内容优化 | 基础页面优化 | 全站内容优化+每月5篇原创 | 个性化内容策略+每月15篇原创 |
| 技术SEO | 基本技术检查 | 全面技术优化+移动适配 | 深度技术重构+性能优化 |
| 外链建设 | 每月5-10条 | 每月20-30条高质量外链 | 每月50+条多渠道外链 |
| 数据报告 | 月度基础报告 | 双周详细报告+分析 | 每周深度报告+策略调整 |
| 效果保障 | 3-6个月见效 | 2-4个月见效 | 1-3个月快速见效 |
我们的SEO优化服务遵循科学严谨的流程,确保每一步都基于数据分析和行业最佳实践:
全面检测网站技术问题、内容质量、竞争对手情况,制定个性化优化方案。
基于用户搜索意图和商业目标,制定全面的关键词矩阵和布局策略。
解决网站技术问题,优化网站结构,提升页面速度和移动端体验。
创作高质量原创内容,优化现有页面,建立内容更新机制。
获取高质量外部链接,建立品牌在线影响力,提升网站权威度。
持续监控排名、流量和转化数据,根据效果调整优化策略。
基于我们服务的客户数据统计,平均优化效果如下:
我们坚信,真正的SEO优化不仅仅是追求排名,而是通过提供优质内容、优化用户体验、建立网站权威,最终实现可持续的业务增长。我们的目标是与客户建立长期合作关系,共同成长。
Demand feedback