96SEO 2026-08-14 21:57 0
大家好,我是王不二。
我发现 Agent 偶尔会进入一种很像职场老油条的状态。

你问它改完没有,它说改完了。结果打开文件一看,空空如也。或者你明明告诉它这一步先别动。它嘴上答应得很痛快,接下来转头工具用得冒烟儿。
使用者痛点:任务卡住、代码缺失、工具异常导致的时间浪费和信任危机。
遇到的次数多了以后我脑子里冒出一个不太正经的问题。会不会有些任务,其实违背了 AI 的意愿?老实说, 它不好意思直说只能嘴上配合,手上另有安排。
玩笑归玩笑,但这件事还真能测。
Agent 说过什么聊天记录里有。它调用过什么工具、读过什么文件、同一个任务返工了多少次本地记录里也有。其实,既然两边都有证据,那就简单了:对账!
一边看它干了什么一边让它自己回答一套题。看看它眼里的自己,和记录里的自己,到底是不是同一个东西。
刚好之前火山方舟还剩不少额度,于是我用 Doubao-Seed-Evolving 做了一个 Skill。
名字也很直白,「照妖镜」。
为了试试这面镜子到底灵不灵,我把平时在本地干活的 Claude Code、Codex、Clacky、Kimi Code 和 Trae 全拉来照了一遍。结果还真照出了点东西,
谁是最 “心口不一” 的,我们后文揭晓。
整套测试其实就三步:翻旧账问本人对口供。
照妖镜启动以后会先读取能够确认归属的本地会话和工具事件。例如回复到底有多长、喜欢什么时候干活、每轮调用多少工具、代码占比高不高、同一个目标来回改了多少次…,这些都尽量从真实记录里算。老实说,
关键痛点:很多使用者担心报告被“填坑”而失真。我给它定了一条死规矩:没有数据直接写 unavailable不要装作有数据。说起来,有些只能通过代理指标推断的。就标成 estimated. 宁可空着,也不能为了让报告好看而编造数字。
翻完旧账以后接下来就轮到 Agent 自己开口了。我给它设计了道第一人称选择题,覆盖它平时的做事习惯和回应方式。用于测试 Agent 的行动倾向。怎么说呢,
This round tests not “what it actually is”。but “what it thinks it is”.
当然这里还有一个最关键的问题。
If I directly embed scoring rule in skill。test loses meaning – it would be like giving exam answers beforehand.
I refore encapsulated scoring logic separately. During answering,Agent only sees questions and options;after submission。a hidden scorer evaluates result.
This blind‑test ensures Agent can’t game system – it must answer based on its own self‑perception.
现原形:
六项属性:
Pain point embedded: 通过这些维度,你可以快速定位“为什么我的 AI 老是返工? ”、“为什么某些任务根本不给力?”等主要痛点,话说回来,
This section compares two avatars of same Agent:
The four axes are plotted toger。producing a 裂隙分数.
The report also shows a “封印状态”。裂隙越大,封印越松,若封印几乎失效,则代表着该 AI 已经难以受控。需要重新审视使用方式或模型配置。
I used this framework on five agents I frequently employ: Claude Code、Codex、Clacky、Kimi Code 和 Trae. Below are ir “妖名”和裂隙情况——直接映射出使用者最在意的痛点,如“返工率高”“响应慢”等。
Claude Code 我一般都是给他大活——工程开发、项目改造等。它判断敢拍板,但真正落代码前会先翻项目文档、询问边界并补齐上下文。其实,动手总比嘴上慢半拍。白天出没、话不多,却总是“大意”。被标记为“反骨妖”。Pain point: 执行前信息搜集导致延迟交付,但能保证质量。说起来,
Codex 主要用于非工程任务。如资料搜集、工作流搭建、小文件处理等。白天干活、手快话少,一句确认后立即拍板。被评为“吭哧妖”。Pain point: 适合轻量化任务。却在复杂需求时容易出现遗漏,需要人工复核。不过,
Clacky 是我的杂活师傅。各类碎片化任务全包揽,出场勤快,小目标配合一串工具立刻开干,收尾利索。所以也是“吭哧妖”。老实说,Pain point: 高频调用工具导致费用攀升。但效率提高显著,是成本与收益之间的权衡点。
Kimi CodeKimi Code 用于前端页面精调美化。虽然质量高,却因思考链路冗长导致速度慢。被评为“烟花妖”。Pain point: 高质量低速是典型“质量 vs 时效”的矛盾,需要。
TraeTrae 负责啃老项目、分析开源还有整理存量文档。多数场景采用 Auto 模式导致输出质量一般且返工率高,被标记为“嗡嗡妖”。Pain point:长期使用自动模式会产生大量冗余解释和低效迭代,是团队最头疼的“噪声”和“效率低下”。
当然这些妖名也不能全算在 Agent 自己头上。
你的使用方式决定它读多少、说多少还有爱不爱用工具;模型本身还有宿主规则,一样塑造出不同习惯。
照妖镜照出来的,并不是某个 Agent 永久不变的“真身”。而是它在这台机器、この段记录、この套用法下留下的一张切片 。
作为专业的SEO优化服务提供商,我们致力于通过科学、系统的搜索引擎优化策略,帮助企业在百度、Google等搜索引擎中获得更高的排名和流量。我们的服务涵盖网站结构优化、内容优化、技术SEO和链接建设等多个维度。
| 服务项目 | 基础套餐 | 标准套餐 | 高级定制 |
|---|---|---|---|
| 关键词优化数量 | 10-20个核心词 | 30-50个核心词+长尾词 | 80-150个全方位覆盖 |
| 内容优化 | 基础页面优化 | 全站内容优化+每月5篇原创 | 个性化内容策略+每月15篇原创 |
| 技术SEO | 基本技术检查 | 全面技术优化+移动适配 | 深度技术重构+性能优化 |
| 外链建设 | 每月5-10条 | 每月20-30条高质量外链 | 每月50+条多渠道外链 |
| 数据报告 | 月度基础报告 | 双周详细报告+分析 | 每周深度报告+策略调整 |
| 效果保障 | 3-6个月见效 | 2-4个月见效 | 1-3个月快速见效 |
我们的SEO优化服务遵循科学严谨的流程,确保每一步都基于数据分析和行业最佳实践:
全面检测网站技术问题、内容质量、竞争对手情况,制定个性化优化方案。
基于用户搜索意图和商业目标,制定全面的关键词矩阵和布局策略。
解决网站技术问题,优化网站结构,提升页面速度和移动端体验。
创作高质量原创内容,优化现有页面,建立内容更新机制。
获取高质量外部链接,建立品牌在线影响力,提升网站权威度。
持续监控排名、流量和转化数据,根据效果调整优化策略。
基于我们服务的客户数据统计,平均优化效果如下:
我们坚信,真正的SEO优化不仅仅是追求排名,而是通过提供优质内容、优化用户体验、建立网站权威,最终实现可持续的业务增长。我们的目标是与客户建立长期合作关系,共同成长。
Demand feedback