96SEO 2026-08-03 16:54 22
让 AI 扮演安全专家审代码、扮演产品经理审需求——这件事不少人做。但有一个隐蔽陷阱很少有人提:多名 AI 评审达成统一意见,不代表结论可靠。 当你让同一个模型同时扮演“安全专家”“架构师”“测试”,角色换了底下的推理引擎没换。很容易形成「集体幻觉」——所有人一起犯一样的错,你分不清是真共识还是一个盲区在多个角色间的回声。网上大多数多角色 Prompt 方案,没有解决这个根本缺陷。
这套思路起源于今年 月参与 alirezarezvani/claude-skills 开源项目讨论时提出的命名人物质疑性评审概念。PR 因结构缺陷未合并,但维护者认可主要 idea。自行开了 # 硬化实现并署了我的名。这个经历让我意识到很多开发者在独立工作中遇到了一样的难题——于是有了这套完整工程。

针对重度技术写作、实验校验、代码审查场景,我自研了一套双池专家评审架构。下文完整介绍工作流、调度机制、自动化脚本。同时客观说明这套程序的维护成本和固有限制——不神化,不推销。⚠️ 本方案有持续知识库维护成本,不适合追求开箱即用的轻度使用者。
痛点:把 AI 当成抽象“安全专家”会导致答案缺乏可追溯来源,容易被模型幻觉误导。
别让 AI 扮演“安全专家”。给它一个真实的人名,一个有文档记录、可搜索、可溯源原则的人。
Ken Thompson不是“安全专家”。他在那一年的图灵奖演讲 Reflections on Trusting Trust 给了你一个实际的分析透镜——供应链风险、第三方代码的信任边界、在信任边界处校验输入。不是一种感觉,而是你可以自己去读的文档化框架。
Don Norman不是“UX 审查者”。《设计心理学》中的可供性、示能、概念模型章节,可搜索,可验证。
实际案例:Torvalds 在 TED 演讲里演示“好品味”——遍历链表删除节点的函数,一般人会写一堆 If 判断边界条件。他消除特殊情况,零个 If,代码行数减半。这不是“风格好”,而是消除特殊情况,而不是处理特殊情况。
当这些人审查你的工作时反馈锚定在模型生成循环之外的某个东西上。不过,Carmack 不会说“建议调整一下”。他会标出你在没有测量的情况下猜测性能,因为他的文档化原则是“先测量,再调整”。话说回来,你可以验证这条原则,并决定它是否适用于这里。
这就是反伪造纪律。
high — 我能给你看来源,置信度高。moderate — 与他们文档化的工作一致,但找不到精确引文。low — 我的推断,明确标注。当作建议处理,不是分析,
规则:做不到 moderate 以上置信度,删掉这个人。宁可少几个真专家,也不加一个伪造的。说起来,模型会很乐意编一段听起来合理的 Carmack 语录。别让它得逞,
我的固定池:
Pain point:即使前提使用真实人物,也无法改变底层模型统一推理的问题。
命名原则确实比“扮演质疑者”强。Torvalds 真的在 TED 说了链表那件事 ——审查意见锚定在模型生成循环外的可验证。这是一小块真正的独立性,
但它解耦的是前提,不是推理本身。
SOP:
Pain point:A consensus among multiple roles is more dangerous than a single reviewer because shared blind spot gets amplified.
L跨模型方差分解:让 Claude‑Carmack 与 GPT‑Carmack 同时审同一段。如果两者结果不同,则差异来源于模型而非专家;如果一致,则说明专家池具备一定独立性。其实,这一步仍在实验阶段,是后续主要。不过,
This framework cannot eliminate hallucinations nor replace independent human judgment. It merely makes it harder to be fooled by a single model’s consistent output—while introducing a new class of blind‑spot risk. Use it consciously.
The core pipeline:
Pain point:You waste time manually assigning reviewers for each task。leading to inconsistent coverage and bottlenecks.
routes:
- id: experiment-design
triggers:
load_kb:
design_review:
roles这方面,focus: "method + complexity + clarity"
- id: writing-review
triggers:
load_kb:
voice_review:
从roles来看,- id: code-review
triggers:
code_review:
roles这方面,focus: "trust boundaries + taste + testability"
The routing table automatically fires when a trigger matches,loads appropriate knowledge bases,and dispatches right experts—zero cognitive overhead.
Pain point:The routing table can become stale;knowledge bases decay over weeks without notice,causing outdated feedback to slip through.
Pain point:You often feel insecure when replying to recurring critics—uncertain tone,missed hidden concerns。or superficial answers that don’t address deep objections.
Each feedback item carries its source + confidence level – no black box.
The system’s greatest value isn’t giving you answers—it makes you harder to deceive。including by its own outputs.
这篇文章主要局限 — 推理引擎未解耦 —— 来自 DEV.to 读者 Max Quimby 的评论讨论。好反馈让文章变好,
🔬 hermes-workspace — 路由表 + 专家池 + 机械门,完整工程公开📂 paper-validator — 层 governance 架构。含 L4 漂移预测器👋 GitHub · DEV.to
作为专业的SEO优化服务提供商,我们致力于通过科学、系统的搜索引擎优化策略,帮助企业在百度、Google等搜索引擎中获得更高的排名和流量。我们的服务涵盖网站结构优化、内容优化、技术SEO和链接建设等多个维度。
| 服务项目 | 基础套餐 | 标准套餐 | 高级定制 |
|---|---|---|---|
| 关键词优化数量 | 10-20个核心词 | 30-50个核心词+长尾词 | 80-150个全方位覆盖 |
| 内容优化 | 基础页面优化 | 全站内容优化+每月5篇原创 | 个性化内容策略+每月15篇原创 |
| 技术SEO | 基本技术检查 | 全面技术优化+移动适配 | 深度技术重构+性能优化 |
| 外链建设 | 每月5-10条 | 每月20-30条高质量外链 | 每月50+条多渠道外链 |
| 数据报告 | 月度基础报告 | 双周详细报告+分析 | 每周深度报告+策略调整 |
| 效果保障 | 3-6个月见效 | 2-4个月见效 | 1-3个月快速见效 |
我们的SEO优化服务遵循科学严谨的流程,确保每一步都基于数据分析和行业最佳实践:
全面检测网站技术问题、内容质量、竞争对手情况,制定个性化优化方案。
基于用户搜索意图和商业目标,制定全面的关键词矩阵和布局策略。
解决网站技术问题,优化网站结构,提升页面速度和移动端体验。
创作高质量原创内容,优化现有页面,建立内容更新机制。
获取高质量外部链接,建立品牌在线影响力,提升网站权威度。
持续监控排名、流量和转化数据,根据效果调整优化策略。
基于我们服务的客户数据统计,平均优化效果如下:
我们坚信,真正的SEO优化不仅仅是追求排名,而是通过提供优质内容、优化用户体验、建立网站权威,最终实现可持续的业务增长。我们的目标是与客户建立长期合作关系,共同成长。
Demand feedback