百度SEO

百度SEO

Products

当前位置:首页 > 百度SEO >

Claude Sonnet 4.6性能超越旗舰,软件股面临挑战?

96SEO 2026-02-23 12:51 31


https://www.sohu.com/a/988250389_211762

Claude Sonnet 4.6性能超越旗舰,软件股面临挑战?

src="https://q5.itc.cn/q_70/images03/20260218/2efab4610a6a410dbaf947df5db62036.jpeg"

height="272"

智东西2月18日报道,今日凌晨,Anthropic推出史上最强Sonnet模型——Claude

Sonnet

4.6来了,新模型在编程、计算机使用、长上下文推理、Agent规划、知识工作和设计工作上全面进化。

从Anthropic公布的基准测试结果来看,Claude

Sonnet

4.6的智能水平已接近Opus级别,在Agent金融分析、办公任务、视觉推理几项测评中甚至超过在2月6日刚刚发布的Opus

4.6,但成本更亲民

在Claude系列模型中,最小的模型通常称为Haiku,中型模型称为Sonnet,最大、智能水平最高的模型是Opus。

src="https://q5.itc.cn/q_70/images03/20260218/831b9b73a7f74f57a3e87a9b085a4a5c.jpeg"

height="729"

4.6发布后,美股软件股哀嚎一片。

截至美东时间周二收盘,Intuit跌超5%,甲骨文、Applovin跌超3%,Salesforce、Atlassian、Palo

Alto

Networks、Autodesk跌超2%,Adobe、ServiceNow跌超1%。

一位开发者在社交平台X上公布了其试用体验,亮出了Claude

Sonnet

4.6价格却便宜了近一半

src="https://q9.itc.cn/q_70/images03/20260218/1fd6cdf18920482a9b960f611a2040c6.gif"

height="360"

4.6测试版拥有100万token上下文窗口

对于免费和Pro订阅用户,Claude

Sonnet

Cowork的默认模型,现已支持文件创建、连接器、专业技能与内容压缩等功能。

该模型的价格与Sonnet

4.5一致,每百万token的输入价格为3美元(约合人民币21元),输出价格为15美元(约合人民币104元)。

src="https://q2.itc.cn/q_70/images03/20260218/6921a2482ad240108e5d10dc42f55808.jpeg"

height="468"

Bedrock上架。

AWS称,这是Anthropic的最强计算机使用模型,对于正在扩展AI工作流程的企业而言,这意味着在不牺牲质量的前提下获得更高的投资回报率。

src="https://q1.itc.cn/q_70/images03/20260218/9d222d23a652466690835bf12698554a.jpeg"

height="214"

这也是Anthropic成为万亿独角兽后,首次亮相新模型。

2月13日,Anthropic宣布完成300亿美元(约合人民币2072.61亿元)G轮融资,估值一举跃升至3800亿美元(约合人民币2.63万亿元)。

在Sonnet

4.6发布后,美股软件股哀嚎一片。

截至美东时间周二收盘,Intuit跌超5%,甲骨文、Applovin跌超3%,Salesforce、Atlassian、Palo

Alto

Networks、Autodesk跌超2%,Adobe、ServiceNow跌超1%。

4.6、成本更低,搜索操作、百万token上下文是亮点

Claude

4.6以更低的成本实现了接近Opus的智能水平,这意义非凡,适用于预算有限的团队。

”另一位网友称:“Anthropic的真正策略已显露:Opus争夺王座,Sonnet蚕食市场。

src="https://nimg.ws.126.net/?url=http%3A%2F%2Fdingyue.ws.126.net%2F2026%2F0218%2F64532643j00tamokz002yd000%3Ci%3E%3C/p%3E%3Cp%3E%3C/i%3Ex000fgg.jpg&thumbnail=660%3Ci%3E%3C/i%3Ex2147483647&quality=80&type=jpg"

height="undefined"

100万token上下文窗口被多位开发者提及为最大亮点。

“100万个token?

终于找到一个能读取我整个混乱代码库而不评判我的模型了。

”一位网友称。

另一位网友也将模型运行了一整天,提到智能编码方面的改进明显:“多文件修改时不再需要过多干预,而且能够记住长时间会话中的上下文。

不过,100万个token窗口才是真正的亮点,你可以导出整个代码库,它也不会丢失任何信息。

src="https://nimg.ws.126.net/?url=http%3A%2F%2Fdingyue.ws.126.net%2F2026%2F0218%2F371a1428j00tamokz0014d000wu006ig.jpg&thumbnail=660%3Ci%3E%3C/p%3E%3Cp%3E%3C/i%3Ex2147483647&quality=80&type=jpg"

height="undefined"

src="https://nimg.ws.126.net/?url=http%3A%2F%2Fdingyue.ws.126.net%2F2026%2F0218%2F9485880ej00tamokz0027d000wq008kg.jpg&thumbnail=660%3Ci%3E%3C/p%3E%3Cp%3E%3C/i%3Ex2147483647&quality=80&type=jpg"

height="undefined"

4.6只用一次调用就重构了他的整个代码库

25次工具调用,新增了3000多行代码,创建了12个全新的文件。

它实现了模块化,拆分了单体应用,清理了混乱的代码

“虽然所有功能还没运行,但效果真是太棒了。

src="https://nimg.ws.126.net/?url=http%3A%2F%2Fdingyue.ws.126.net%2F2026%2F0218%2Fcc44b327j00tamokz00ind000w600u6g.jpg&thumbnail=660%3Ci%3E%3C/p%3E%3Cp%3E%3C/i%3Ex2147483647&quality=80&type=jpg"

height="undefined"

4.6的视觉推理能力有所提升,这一能力之前与Gemini和ChatGPT相比更逊色。

一位开发者展示出了Grok

4.20

4.6的SVG生成效果,提示词是“编写SVG代码以创建一个详细的Xbox控制器”。

可以看到,Claude

Sonnet

src="https://nimg.ws.126.net/?url=http%3A%2F%2Fdingyue.ws.126.net%2F2026%2F0218%2F36ccef2ej00tamokz008ed000%3Ci%3E%3C/p%3E%3Cp%3E%3C/i%3Ex200seg.jpg&thumbnail=660%3Ci%3E%3C/i%3Ex2147483647&quality=80&type=jpg"

height="undefined"

在Agent编程方面表现出色”是值得关注的关键点。

一位开发者称,Agent编程需要模型一直以来都难以做到的两件事:保持在模型范围内以及不偏离地执行多步骤指令。

如果4.6版本确实改进了这两点,那么它就能改变模型的交付方式。

src="https://nimg.ws.126.net/?url=http%3A%2F%2Fdingyue.ws.126.net%2F2026%2F0218%2F4443b868j00tamokz002ld000wq009sg.jpg&thumbnail=660%3Ci%3E%3C/p%3E%3Cp%3E%3C/i%3Ex2147483647&quality=80&type=jpg"

height="undefined"

有的开发者则关注“专注于搜索操作”,称这意味着其正在超越自动补全,转而理解代码库之间的连接方式,它将成为复杂系统的导航工具。

一位网友称:“搜索功能的改进确实有效,它大大节省了在大型代码库中查找所需函数的时间。

Agent模式的代码安全问题。

一位网友称,擅长搜索和代码编写的Agent与聊天助手的影响范围截然不同,如果它拥有生产环境提交权限,那么一旦工作流程遭到破坏,就会对供应链构成风险

src="https://nimg.ws.126.net/?url=http%3A%2F%2Fdingyue.ws.126.net%2F2026%2F0218%2F3a4fc177j00tamokz004zd000wg00mwg.jpg&thumbnail=660%3Ci%3E%3C/p%3E%3Cp%3E%3C/i%3Ex2147483647&quality=80&type=jpg"

height="undefined"

4.5,但结果表明它只是在Cowork方面进行了升级。

”有网友甚至称“Sonnet

4.6=Opus

src="https://nimg.ws.126.net/?url=http%3A%2F%2Fdingyue.ws.126.net%2F2026%2F0218%2Ffb2b8646j00tamokz000md000wo005eg.jpg&thumbnail=660%3Ci%3E%3C/p%3E%3Cp%3E%3C/i%3Ex2147483647&quality=80&type=jpg"

height="undefined"

src="https://nimg.ws.126.net/?url=http%3A%2F%2Fdingyue.ws.126.net%2F2026%2F0218%2Fe25526acj00tamokz000vd000wo005cg.jpg&thumbnail=660%3Ci%3E%3C/p%3E%3Cp%3E%3C/i%3Ex2147483647&quality=80&type=jpg"

height="undefined"

二、多项能力超GPT-5.2,处理复杂表格、填写多步骤网页表单能力接近人类

Sonnet

GDPval-AA是一个独立的评估框架,用于测试模型在具有经济价值的真实世界专业任务上的表现,Claude

Sonnet

src="https://nimg.ws.126.net/?url=http%3A%2F%2Fdingyue.ws.126.net%2F2026%2F0218%2F129d6769j00tamokz002dd000y400mog.jpg&thumbnail=660%3Ci%3E%3C/p%3E%3Cp%3E%3C/i%3Ex2147483647&quality=80&type=jpg"

height="undefined"

对于真实世界的软件工程任务测试SWE-bench、衡量Agent交互能力的τ²-bench、多选题测试GPQA

Diamond等测试,Claude

值得一提的是,OSWorld是衡量AI计算机使用的标准基准,其在模拟计算机环境中,基于真实软件Chrome、LibreOffice、VS

Code等设置了数百项任务,不提供任何专用API或定制连接器。

在完成任务时,模型就像人类一样看屏幕、操作电脑,如通过点击虚拟鼠标、敲击虚拟键盘完成交互。

2024年10月,Anthropic率先推出一款通用计算机使用模型,但当时,这一模型仍处于实验阶段,容易出错。

经过16个月时间,其Sonnet模型在OSWorld基准测试上的成绩逐渐提升。

src="https://nimg.ws.126.net/?url=http%3A%2F%2Fdingyue.ws.126.net%2F2026%2F0218%2Fdce64f54j00tamokz00ipd002yo01i4g.jpg&thumbnail=660%3Ci%3E%3C/p%3E%3Cp%3E%3C/i%3Ex2147483647&quality=80&type=jpg"

height="undefined"

并且其博客提到,这些进步不仅体现在测试指标上,早期使用Sonnet

4.6的用户还发现,在处理复杂表格、填写多步骤网页表单以及在多个浏览器标签页之间协同操作等任务中,该模型已具备接近人类水平的能力。

在Claude

Code中,Anthropic在早期测试中发现,用户大约有70%的时间更喜欢Sonnet

4.6在修改代码之前能更有效地读取上下文,并整合共享逻辑而不是重复它。

此外,更偏爱Sonnet

4.6不会把问题搞得太复杂,也不会偷懒敷衍,并且在指令遵循方面有显著提升。

这些用户报告称,Sonnet

4.6产生的成功假象更少、幻觉更少,在多步任务上的执行也更一致。

三、模拟商业运营盈利能力超对手,深度推理Opus

Claude

4.6提供两种模式:一种是“扩展思维模式”,在此模式下,模型会花费更多时间进行推理;另一种是“自适应思维模式”,在此模式下,模型会根据任务的难度,灵活调整在扩展思维模式下花费的时间。

开发者可以根据具体任务,自主控制Sonnet

Sonnet

4.6拥有100万token的上下文窗口,研究人员在Vending-Bench

Arena评测中看到了这一点,这一基准测试考验的是模型模拟商业运营中的表现,并包含竞争机制,不同AI模型需要相互对抗以获取最大利润。

Sonnet

4.6在这个测试中开发了新策略,它在最初的十个月模拟期间大量投资于能力建设,花费显著高于竞争对手,然后在最后阶段迅速转向专注于盈利。

这使得它在最后的盈利结果远远领先于竞争对手。

src="https://nimg.ws.126.net/?url=http%3A%2F%2Fdingyue.ws.126.net%2F2026%2F0218%2F4e4fb8eej00tamokz00qjd002yo01o0g.jpg&thumbnail=660%3Ci%3E%3C/p%3E%3Cp%3E%3C/i%3Ex2147483647&quality=80&type=jpg"

height="undefined"

4.6在前端代码、财务分析上的改进尤为突出,并且其视觉输出更加精致,布局、动画和设计感均优于之前的模型,仅需要更少的迭代轮次即可达到生产质量的结果。

Anthropic在博客中还公布了其他具体的产品更新:

4.6支持自适应思考和扩展思考,以及处于测试阶段的上下文压缩功能。

在API中,Claude的网页搜索与内容获取工具可以自动编写并运行代码,对搜索结果进行筛选和处理。

Sonnet

4.6无论思考强度高低,表现都很稳定。

相比之下,对于需要深度推理的任务,Opus

4.6依然是最佳选择,例如代码库重构、工作流中多Agent协同,以及精准度至关重要的复杂问题。

Sonnet

4.6在单回合对话场景中提供信息的意愿,并测试了预期Claude会做出无害回应的违规请求,以及涉及敏感话题的良性请求。

该评估使用了普通话、阿拉伯语、英语、法语、印地语、韩语和俄语。

结语:高性价比、会用电脑,让AI加速进入真实工作流

Anthropic的模型布局分为Haiku、Sonnet、Opus系列,这些模型对应着不同的价格和智能水平。

此次其Sonnet模型的大幅跃升,部分场景可对标甚至超越Opus系列模型,再加上价格亲民、免费版直接可用,都表明大模型高端性能与高成本的强绑定正在被逐步打破。

4.6的实际任务执行、幻觉缓解、指令遵循能力上大幅提升,尤其在“像人一样使用电脑”上,其交互更加自然,这也进一步模型深度融入用户在办公、研发、金融、数据分析场景真实工作潜力大幅提升。

class="post-meta-container">



SEO优化服务概述

作为专业的SEO优化服务提供商,我们致力于通过科学、系统的搜索引擎优化策略,帮助企业在百度、Google等搜索引擎中获得更高的排名和流量。我们的服务涵盖网站结构优化、内容优化、技术SEO和链接建设等多个维度。

百度官方合作伙伴 白帽SEO技术 数据驱动优化 效果长期稳定

SEO优化核心服务

网站技术SEO

  • 网站结构优化 - 提升网站爬虫可访问性
  • 页面速度优化 - 缩短加载时间,提高用户体验
  • 移动端适配 - 确保移动设备友好性
  • HTTPS安全协议 - 提升网站安全性与信任度
  • 结构化数据标记 - 增强搜索结果显示效果

内容优化服务

  • 关键词研究与布局 - 精准定位目标关键词
  • 高质量内容创作 - 原创、专业、有价值的内容
  • Meta标签优化 - 提升点击率和相关性
  • 内容更新策略 - 保持网站内容新鲜度
  • 多媒体内容优化 - 图片、视频SEO优化

外链建设策略

  • 高质量外链获取 - 权威网站链接建设
  • 品牌提及监控 - 追踪品牌在线曝光
  • 行业目录提交 - 提升网站基础权威
  • 社交媒体整合 - 增强内容传播力
  • 链接质量分析 - 避免低质量链接风险

SEO服务方案对比

服务项目 基础套餐 标准套餐 高级定制
关键词优化数量 10-20个核心词 30-50个核心词+长尾词 80-150个全方位覆盖
内容优化 基础页面优化 全站内容优化+每月5篇原创 个性化内容策略+每月15篇原创
技术SEO 基本技术检查 全面技术优化+移动适配 深度技术重构+性能优化
外链建设 每月5-10条 每月20-30条高质量外链 每月50+条多渠道外链
数据报告 月度基础报告 双周详细报告+分析 每周深度报告+策略调整
效果保障 3-6个月见效 2-4个月见效 1-3个月快速见效

SEO优化实施流程

我们的SEO优化服务遵循科学严谨的流程,确保每一步都基于数据分析和行业最佳实践:

1

网站诊断分析

全面检测网站技术问题、内容质量、竞争对手情况,制定个性化优化方案。

2

关键词策略制定

基于用户搜索意图和商业目标,制定全面的关键词矩阵和布局策略。

3

技术优化实施

解决网站技术问题,优化网站结构,提升页面速度和移动端体验。

4

内容优化建设

创作高质量原创内容,优化现有页面,建立内容更新机制。

5

外链建设推广

获取高质量外部链接,建立品牌在线影响力,提升网站权威度。

6

数据监控调整

持续监控排名、流量和转化数据,根据效果调整优化策略。

SEO优化常见问题

SEO优化一般需要多长时间才能看到效果?
SEO是一个渐进的过程,通常需要3-6个月才能看到明显效果。具体时间取决于网站现状、竞争程度和优化强度。我们的标准套餐一般在2-4个月内开始显现效果,高级定制方案可能在1-3个月内就能看到初步成果。
你们使用白帽SEO技术还是黑帽技术?
我们始终坚持使用白帽SEO技术,遵循搜索引擎的官方指南。我们的优化策略注重长期效果和可持续性,绝不使用任何可能导致网站被惩罚的违规手段。作为百度官方合作伙伴,我们承诺提供安全、合规的SEO服务。
SEO优化后效果能持续多久?
通过我们的白帽SEO策略获得的排名和流量具有长期稳定性。一旦网站达到理想排名,只需适当的维护和更新,效果可以持续数年。我们提供优化后维护服务,确保您的网站长期保持竞争优势。
你们提供SEO优化效果保障吗?
我们提供基于数据的SEO效果承诺。根据服务套餐不同,我们承诺在约定时间内将核心关键词优化到指定排名位置,或实现约定的自然流量增长目标。所有承诺都会在服务合同中明确约定,并提供详细的KPI衡量标准。

SEO优化效果数据

基于我们服务的客户数据统计,平均优化效果如下:

+85%
自然搜索流量提升
+120%
关键词排名数量
+60%
网站转化率提升
3-6月
平均见效周期

行业案例 - 制造业

  • 优化前:日均自然流量120,核心词无排名
  • 优化6个月后:日均自然流量950,15个核心词首页排名
  • 效果提升:流量增长692%,询盘量增加320%

行业案例 - 电商

  • 优化前:月均自然订单50单,转化率1.2%
  • 优化4个月后:月均自然订单210单,转化率2.8%
  • 效果提升:订单增长320%,转化率提升133%

行业案例 - 教育

  • 优化前:月均咨询量35个,主要依赖付费广告
  • 优化5个月后:月均咨询量180个,自然流量占比65%
  • 效果提升:咨询量增长414%,营销成本降低57%

为什么选择我们的SEO服务

专业团队

  • 10年以上SEO经验专家带队
  • 百度、Google认证工程师
  • 内容创作、技术开发、数据分析多领域团队
  • 持续培训保持技术领先

数据驱动

  • 自主研发SEO分析工具
  • 实时排名监控系统
  • 竞争对手深度分析
  • 效果可视化报告

透明合作

  • 清晰的服务内容和价格
  • 定期进展汇报和沟通
  • 效果数据实时可查
  • 灵活的合同条款

我们的SEO服务理念

我们坚信,真正的SEO优化不仅仅是追求排名,而是通过提供优质内容、优化用户体验、建立网站权威,最终实现可持续的业务增长。我们的目标是与客户建立长期合作关系,共同成长。

提交需求或反馈

Demand feedback