Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线
AWS 宣布 Claude Sonnet 5.5 今日在 Amazon Bedrock 和 Claude Platform on AWS 上线,面向范围明确的编码与知识工作。
推荐理由:文中按判断密集型与执行路径明确的任务划分两款模型的分工,为企业在编码和知识工作中选择模型提供了具体参考。
AWS 宣布 Claude Sonnet 5.5 今日在 Amazon Bedrock 和 Claude Platform on AWS 上线,面向范围明确的编码与知识工作。
推荐理由:文中按判断密集型与执行路径明确的任务划分两款模型的分工,为企业在编码和知识工作中选择模型提供了具体参考。
Amazon Bedrock 新增 Claude 模型印度境内推理支持,通过地理跨区域推理将数据处理限定在印度。可用模型包括 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5。请求仅在孟买与海得拉巴区域之间路由,用户可通过控制台或 API 访问。
Amazon Bedrock 现支持在首尔对 Claude Opus 5 和 Claude Sonnet 5、在新加坡对 Claude Sonnet 5 进行区域内推理。请求和数据全程留在指定区域,吞吐量受该区域容量及服务配额限制。用户可通过控制台或 bedrock-runtime 端点调用。
ALTK-Evolve 在 AppWorld 上对 8 个模型的评估发现,智能体记忆的合适用量因模型而异,并非注入越多越好。
团队在构建智能体模型路由时发现,模型选择不能仅靠任务难度分类,而需同时优化成本、质量和延迟,并考虑基础设施与治理约束。在 AppWorld Test Challenge 的 417 个任务中,同用 CodeAct 智能体,Claude Sonnet 4.6 因缓存读取价格更低,总成本为 $79,低于 GPT-4.1 的 $155。
ScarfBench 是面向企业 Java 跨框架迁移的开放基准,评测中表现最强的智能体在行为验证环节的成功率仍低于 10%。它覆盖 Spring、Jakarta EE 和 Quarkus,包含 34 个应用、102 个框架实现、204 项迁移任务及 1,331 项专家编写的测试,要求迁移后的应用通过构建、部署和行为验证,而非仅与参考代码比较。
Google Research 与康奈尔大学评测了 6 个 LLM 系统回答高温超导研究问题的能力,NotebookLM 与定制 RAG 系统总体表现领先。专家围绕 67 道问题进行盲评,两个领先系统均依赖经过质量控制的资料库。所有受测系统仍有改进空间,NotebookLM 的证据支持得分最高,但回答最不简洁。