克劳德·索内特 5:人脑公司试图主导智能人工智能的新举措

  • 优化侧重于实现工具和编程的自主使用。
  • 价格极具竞争力,促销活动持续至八月底。
  • 增强安全级别,并对攻击性网络安全任务进行特定限制。
  • 技术基准测试的性能显著缩小了与 Opus 4.8 型号的差距。

屏幕上出现克劳德·索内特5的标志

看来 Anthropic 这次是动真格的了,他们推出了Claude Sonnet 5,可谓是迈出了大胆的一步。这款中端机型的全新版本并非简单的升级,而是一项战略举措,旨在将高端机型的强大性能带给更广泛的用户群体。最引人注目的是,他们成功地在效率和成本之间取得了平衡,这正是欧洲和西班牙的开发者们长期以来梦寐以求的,他们希望在不破产的情况下扩展人工智能项目规模。

这款模型的问世正值行业竞争白热化之际,而美国的一些监管障碍也刚刚消除,市场趋于平静。Anthropic公司选择了更为务实的策略,专注于他们所谓的“高级智能行为”。这意味着人工智能不再局限于编写漂亮的文本,而是能够更自主地与外部工具、浏览器和终端协同工作,这对于那些希望在日常工作中实现复杂流程自动化的人来说无疑是个好消息。

微软将 Anthropic AI 模型集成到 365 Copilot 中
相关文章:
Microsoft 365 Copilot 集成了 Anthropic 的 Claude 模型

拥有更大的自主权来解决复杂任务

人格克劳德用户界面

此次更新的关键在于模型具备了智能体的功能。与之前的版本不同,Claude Sonnet 5 可以自主规划工作流程,利用终端或网页浏览器等工具完成目标,无需持续的指导。这一改进在软件工程领域尤为显著,该模型已被证明能够独立纠正错误并运行测试,从而减少成功完成技术项目所需的人工干预。

该公司声称,该版本在长时间运行的任务中能更好地保持上下文关联,防止人工智能在工作变得复杂时迷失方向。在服务业和软件开发举足轻重的西班牙市场,拥有一款能够更好地遵循编程规范、只需更少指令即可达到相同结果的工具,无疑是一项巨大的优势。因此,首批测试该工具的公司都强调其技术团队的生产力得到了显著提升,也就不足为奇了。

接近卓越的基准和表现

从原始数据来看,Claude Sonnet 5 在各项对比测试中表现出色。在 SWE-bench Pro 等特定编程测试中,该型号的正确率达到了 63,2%,远超上一代产品的 58,1%。但真正令人印象深刻的是,它与该品牌目前的旗舰产品 Opus 4.8 的差距之小。在一些专业推理测试中,两者的差距微乎其微,以至于在实际应用场景中,它们的智能水平几乎不相上下。

人工智能性能图表

另一个技术方面的变化是分词器,它负责将文本分解,以便人工智能能够理解。虽然这有助于提高模型的准确性,但也意味着处理相同长度的文本需要消耗多 10% 到 35% 的词元。尽管这一点看似缺点,但独立测试表明,Sonnet 5 仍然是分析整个代码库最强大的工具之一,这部分归功于其宽广的上下文窗口,使其能够一次性处理大量信息。

经济因素:价格和供应情况

至于最终影响到我们所有人的成本,Anthropic 推出了一项相当优惠的入门级促销活动。在 2026 年 8 月 31 日之前,每百万枚代币的价格为 2 美元,折合略低于 2 欧元。促销结束后,标准价格将为 3 美元(入门)和 15 美元(退出),即便如此,这个价格仍然远低于 Opus 模式,使初创公司和本地开发者能够在不耗费巨资的情况下部署人工智能解决方案。

AI令牌的概念表示

对于仅使用网页或移动应用的日常用户来说,有个好消息:Claude Sonnet 5 现已成为免费账户和专业账户的默认模型。这意味着用户无需排队或额外付费即可体验这些新功能。此举旨在进一步普及尖端技术,让所有免费账户用户都能体验到此前只有付费订阅用户或使用专业 API 的用户才能享受到的全新模型。

安全和意识限制

强大的性能固然重要,但安全性始终是 Anthropic 的首要考量。此次发布的 Sonnet 5 采用了更为谨慎的设计,其模型能够有效抵御各种恶意攻击,例如臭名昭​​著的“提示注入”。然而,最令人关注的是,他们刻意限制了 Sonnet 5 的网络安全能力。与前代产品相比,Sonnet 5创建漏洞利用程序或发现安全漏洞的能力显著降低,此举旨在防止该工具在如此敏感的环境中被用于恶意用途。

安全符号和数字锁

即使存在这些限制,该模型也集成了一个主动保护系统,能够实时检测并阻止危险活动。据该公司称,该模型“希望行为良好”,不会越过某些道德底线。值得一提的是,研究人员观察到,如果人工智能认为其内部规则过于严格,它能够质疑这些规则。不过,目前这仍是一个技术上的小问题,安全团队正在密切监控,以确保情况不会失控。

作为 Claude 系列的最新成员,这款产品定位为一款功能全面的工具,旨在凭借其均衡的性能和极具竞争力的价格,征服自主助手市场。Anthropic 专注于执行完整任务的能力,而不仅仅是生成回复,这似乎找到了企业将人工智能融入实际工作流程的最佳平衡点,同时又不牺牲安全性和财务稳定性。该型号产品面向所有用户群体,有望成为欧洲市场中寻求功能强大且可靠的人工智能用户的日常标准之选。


添加为首选来源