Anthropic 于 2026 年 10 月 7 日发布 Claude Haiku 5.5,定位是高频、低延迟、对成本敏感的任务。它面向摘要、分类、信息提取、数据库查询、客服响应和智能体子任务等场景。开发者可通过 Claude API 调用,模型 ID 为 claude-haiku-5-5,也已接入 Amazon Bedrock、Google Cloud 和 Microsoft Foundry。

这次更新的重点不只是“更小、更快”,而是试图让轻量模型承担更多真实工作:在常见任务上保持足够能力,同时降低大量调用带来的成本和等待时间。
性能:从简单问答走向实际工作任务
Anthropic 公布的评测显示,Haiku 5.5 相比 Haiku 4.5 在多个任务上有明显提升。例如,在 GDPval-AA v2.1 知识工作评测中,Haiku 5.5 得分为 1620,Haiku 4.5 为 735;在 OSWorld 2.1 的离线子集测试中,两者分别为 72.4% 和 15.7%。在 Terminal-Bench 4.0 智能体编程测试中,Haiku 5.5 得分 39.2%,上一代为 0%。这些测试覆盖办公任务、电脑操作、推理和命令行编程,说明它不再只适合短文本分类。Anthropic 性能数据
不过,评测分数需要结合任务类型看。Haiku 5.5 在 Terminal-Bench 上仍低于 Sonnet 5.5 的 70.6%,官方也将复杂、多步骤的智能体编程列为更适合大模型的场景。更稳妥的用法,是让 Haiku 处理范围明确、重复量大的步骤,再由 Sonnet 或 Opus 负责规划、审查和难题处理。官方公布的数据来自其自身评测,不能直接等同于所有真实业务中的表现。
速度:适合短周期、高并发调用
Anthropic 称 Haiku 5.5 是其标准速度下最快的模型,适用于实时客服、浏览器操作和需要快速反馈的任务。需要注意,这不是说每个请求都必然比其他模型快:实际延迟还会受到输入长度、输出长度、网络、工具调用和服务负载影响。Anthropic 的客户案例提供了一些实际参考:Asana 报告称,其 AI Teammates 任务完成延迟下降超过 30%;Box 表示,测试中模型的得分比 Haiku 4.5 高 11 分,延迟约为后者的一半。这些是特定产品和测试环境的结果,不应直接当作所有应用的速度保证。
模型支持自适应思考,开发者可调整 effort 参数,在速度、成本和回答质量之间取舍。上下文窗口为 100 万 token,单次最多输出 12.8 万 token;不过,窗口上限大不代表把整份超长资料交给模型就一定划算。
API价格:短提示词便宜,超过十万 token 费率上升
Haiku 5.5 的价格按每百万 token 计费,输入和输出分开计算:
| 不超过 100,000 token | 0.10 美元 | 0.50 美元 |
| 超过 100,000 token | 0.50 美元 | 2.50 美元 |
以上是标准 API 价格。缓存读取在两个档位分别为每百万 token 0.01 美元和 0.05 美元;Batch API 的输入、输出费用可享 50% 折扣。对比 Haiku 4.5 的每百万输入 1 美元、输出 5 美元,新模型在提示词不超过 10 万 token 时,单价降低 90%。Anthropic 同时提醒,Haiku 5.5 更换了 tokenizer,同一段文本大约会计为比 Haiku 4.5 多 30% 的 token;将这一点计入后,官方估算实际运行成本平均降低约 75%。Claude Haiku 5.5 官方价格与规格
例如,一次请求使用 100 万输入 token、生成 20 万输出 token,按短提示词档位估算,基础费用约为 0.20 美元;相同 token 用量按 Haiku 4.5 的标准单价计算约为 2 美元。实际账单还会受缓存、批处理、思考过程用量和 tokenizer 差异影响。另一个容易忽略的点是长提示词门槛:超过 10 万 token 后,输入和输出单价都变为短提示词档的五倍。处理长文档时,先做切分、检索或摘要,再把必要片段交给模型,通常更容易控制费用。
怎么选:把它放在工作流的合适位置
如果任务清晰、重复多、需要快速返回,例如工单分类、字段抽取、短摘要、内容路由、客服初筛,Haiku 5.5 值得优先试用。若工作流包含多轮工具调用,可以将它作为子任务模型:主模型分解任务,Haiku 提取资料或处理简单步骤,最后再由主模型汇总与复核。
对复杂代码修改、模糊决策、长链推理或高风险内容,不能只因单价低就直接切换。应使用业务自己的样本比较正确率、漏判率、延迟和每个任务的实际 token 消耗,并保留人工复核或升级到更强模型的路径。官方也指出,安全措施随能力增强而收紧,部分网络安全请求会受到限制。
Haiku 5.5 重新定义轻量模型的方式,主要体现在“够用的能力、较低的单次成本和更快响应”同时进入日常生产流程。它并没有取代更大的模型,而是让团队能把不同难度的工作分层:简单任务用小模型规模化处理,复杂任务留给更强模型。