Claude Haiku 5.5 API

Claude Haiku 5.5 于 2026-10-07 发布,是 Anthropic 目前最便宜、最快的模型,也是第一个支持 effort 档位的 Haiku。它按提示长度分档计价:100K token 以内比 Haiku 4.5 便宜 90%,超过 100K 后整条请求按 5 倍价格计费。本页汇总价格怎么算、官方跑分、与 GPT-6 Luna 和 Sonnet 5.5 怎么选、社区评价、从 Haiku 4.5 迁移会遇到的 400,以及在 Claude Code 中启用的方法。

价格对比:官方、OpenRouter 与 Wokey

每百万 token 美元价。官方与 OpenRouter 价格为 2026-10-08 人工核对,不含税;Wokey 价格读取实时价目表。

渠道输入缓存读取输出
官方 API$0.1$0.01$0.5
OpenRouter$0.1$0.01$0.5
Wokey$0.08$0.008$0.4

上表为提示 100,000 token 以内的价格。提示(输入 + 缓存读取 + 缓存写入)超过 100,000 时,官方和 OpenRouter 整条请求按输入 $0.5 / 输出 $2.5 计费,Wokey 同样按提示长度分档,长提示价格见下方价格明细。

· 官方价格页 · OpenRouter 端点列表

在 Claude Code 中使用

该模型在 Wokey 上支持 /v1/messages,设置以下环境变量后启动 claude 即可。

export ANTHROPIC_BASE_URL="https://api.wokey.ai"
export ANTHROPIC_AUTH_TOKEN="$WOKEY_API_KEY"
export ANTHROPIC_MODEL="claude-haiku-5-5"

Claude Haiku 5.5 要点

发布日期
2026-10-07,Claude 5.5 系列最后一个模型(Opus 5.5 于 09-22、Sonnet 5.5 于 09-28 发布);Claude Code 2.1.293 起 haiku 别名在 Anthropic API 上默认指向它
官方定位
面向大批量、对延迟敏感的任务(分类、抽取、路由、摘要、上下文压缩),以及给 Opus 5.5 / Sonnet 5.5 当子代理;官方称其为最快的模型,平均运行成本比 Haiku 4.5 低约 75%
官方价格(分档)
提示 100K token 以内:输入 $0.10 / 输出 $0.50,缓存读取 $0.01,5 分钟缓存写入 $0.125,1 小时 $0.20。提示超过 100K:所有计费项 ×5($0.50 / $2.50)。提示 = 输入 + 缓存读取 + 缓存写入;Batch 再打 5 折
上下文与输出
1M 上下文(无需 beta 头);最大输出 128K,Batch API 加 output-300k-2026-03-24 beta 头可到 300K
思考与 effort
自适应思考默认开启,默认 effort 为 medium(API 与 Claude Code 相同),共 low / medium / high / xhigh / max 五档;思考内容默认不返回文本
分词器
与 Claude 4.7 及之后的模型相同,同样的文本比 Haiku 4.5 多约 30% token,按 token 估算的成本和 max_tokens 需要重算
模型 ID
claude-haiku-5-5(无日期后缀,也没有单独的别名;Bedrock 为 anthropic.claude-haiku-5-5)

· 来源: Anthropic · 迁移指南

官方跑分:Haiku 5.5 vs Haiku 4.5 vs GPT-6 Luna vs Sonnet 5.5

数据来自 Anthropic 的 Haiku 5.5 发布页,是厂商自测结果;“—”表示官方未公布该项。Sonnet 5.5 一列是官方给出的参考,FrontierCode 一项为 xhigh 档。

基准Haiku 5.5Haiku 4.5GPT-6 LunaSonnet 5.5
GDPval-AA v2.1162073514371840
AA-Briefcase v1.1157861413361824
OSWorld 2.1 (offline subset)72.4%15.7%48.9%83.9%
Humanity's Last Exam (no tools)45.9%10.2%—56.9%
Humanity's Last Exam (tools)57.4%18.7%—64.5%
Terminal-Bench 4.039.2%0.0%16.4%70.6%
FrontierCode 1.1 Main46.4%—42.4%52.1%
Chartography (no tools)46.4%6.4%29.1%61.6%

Terminal-Bench 4.0 上 Haiku 5.5 用 Claude Code、GPT-6 Luna 用 Codex(公开排行榜),测试条件不同,不宜直接比较。OSWorld 这里是离线子集,与 Sonnet 5.5 发布页的数字不可比。Artificial Analysis 智能指数(v4.3.2)独立复测:Haiku 5.5 在 max 档为 43(xhigh 41、high 38、medium 34、low 29),Haiku 4.5 为 17,Sonnet 5.5 为 56,Opus 5.5 为 58;多家报道援引同一指数中 GPT-6 Luna(max)为 38。

怎么选:Haiku 5.5、GPT-6 Luna 还是 Sonnet 5.5

对比 Haiku 4.5

定位相同,可以直接替换:100K 以内单价便宜 90%,超过 100K 便宜 50%,官方跑分全面领先(Terminal-Bench 4.0 从 0% 到 39.2%,OSWorld 从 15.7% 到 72.4%)。替换前检查下方的迁移清单,并按新分词器重新估算 token:同样的文本多约 30% token。

对比 GPT-6 Luna

100K 以内两者官方单价相同($0.10 / $0.50),Haiku 5.5 的官方跑分和 Artificial Analysis 指数都更高(43 vs 38)。但 Luna 的长上下文加价从 272K 才开始,且只是输入 2 倍、输出 1.5 倍,长提示场景 Luna 明显更便宜;社区实测里 Haiku 5.5 高档位的 token 消耗也更大。提示多数在 100K 以内、看重质量选 Haiku 5.5;长上下文、对成本敏感选 Luna。

对比 Sonnet 5.5

复杂的 agentic 编码选 Sonnet 5.5(Terminal-Bench 70.6% vs 39.2%);范围明确的检索、摘要、分类、代码库探索和子代理任务交给 Haiku 5.5,官方单价约为 Sonnet 5.5 的 1/20。常见搭配是 Opus 5.5 或 Sonnet 5.5 做主会话,Haiku 5.5 跑子代理。

Effort 怎么设

默认 medium 适合多数任务;分类、抽取这类简单请求用 low,Artificial Analysis 测得 low 档首个答案 token 只要 6.3 秒、每个指数任务约 $0.02。max 档每个任务平均约 $0.21、输出 token 量很大,社区测试中 max 比 low 慢几十倍;如果需要开到 xhigh / max,可以先试 Sonnet 5.5 的 low / medium。

官方 effort 文档

第三方与社区评价

  • Artificial Analysis: 智能指数(v4.3.2)max 档 43,比 Haiku 4.5 高 26 分;输出速度约 243 token/s(max 档)。跑完一个指数任务按官方价 max 档平均 $0.21、low 档 $0.02;max 档跑完整个指数共输出 4.4 亿 token,偏啰嗦。
  • Hacker News(638 分、321 条评论): 正面:终于和 GPT-6 Luna 同价(Simon Willison:Haiku 4.5 曾是 Luna 的 10 倍价),质量明显好于 Luna,适合给大模型当子代理。质疑:100K 的分档门槛太低,agentic 会话很容易超过;新分词器同样文本多 30% token;按 Artificial Analysis 的单任务成本,Haiku 仍约为 Luna 的 3 倍;low 档质量明显下降,xhigh 到 max 的耗时和 token 差距很大。

从 Haiku 4.5 迁移:会返回 400 的请求

以下变更来自官方迁移指南。直接把 model 改成 claude-haiku-5-5 前,先检查请求。通过 Wokey 调用时,网关会自动处理其中几项,下面逐条注明。

  • thinking: {"type": "enabled", "budget_tokens": N} 返回 400,改用 {"type": "adaptive"} 配合 effort。thinking: {"type": "disabled"} 只能在 high 及以下 effort 使用。Wokey 网关会去掉 budget_tokens 手动预算、去掉 xhigh / max 下的 disabled,改为默认的自适应思考。
  • 非默认 temperature、top_p、top_k 返回 400(temperature 只能是 1,top_p 只能是 0.99,top_k 任何值都会 400)。Wokey 网关会自动去掉这三个字段。
  • 以 assistant 结尾的预填充(prefill)返回 400,即使关闭思考也一样。请改成以 user 结尾,用结构化输出或系统提示代替。
  • 计算机操作工具 computer_20250124 返回 400,改用 computer_toolset_20260801 工具集。
  • 思考块只能在生成它的账号中回放,跨账号会被静默丢弃;改动 system、tools 或历史消息后再带回思考块会 400,会话请保持只追加。
  • 响应可能以 thinking 块开头且默认不含思考文本,请按 type 选取内容块;思考 token 计入 max_tokens,原来设得很小的 max_tokens 需要调大。
  • 强制 tool_choice(any 或指定工具)可以用,但响应直接从工具调用开始、没有思考;拒答返回 stop_reason: "refusal";不支持 Priority Tier。

在 Claude Code 中让 haiku 和子代理使用 Haiku 5.5(Wokey)

export ANTHROPIC_BASE_URL="https://api.wokey.ai"
export ANTHROPIC_AUTH_TOKEN="<your Wokey API key>"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="claude-haiku-5-5"
# Optional: run sub-agents that do not name a model on Haiku 5.5
export CLAUDE_CODE_SUBAGENT_MODEL="haiku"
claude
模型 ID
claude-haiku-5-5
供应商
anthropic
供应状态
当前可调用

目录价格快照

价格单位为每 100 万 tokens;实际结算以请求处理时价格为准。

计费项Wokey官方参考节省幅度
Input$0.08$0.120%
Output$0.4$0.520%
Cache read$0.008$0.0120%
Cache write$0.16$0.220%

提示超过 100K tokens

提示 = 输入 + 缓存读取 + 缓存写入。提示超过 100,000 tokens 时,整条请求(包括输出和缓存)按下表计价;上表为 100K 及以内的价格。

计费项Wokey官方参考节省幅度
Input$0.1$0.580%
Output$0.5$2.580%
Cache read$0.01$0.0580%
Cache write$0.2$180%

官方价格来源: https://platform.claude.com/docs/en/models/haiku-5-5/overview

模型能力

Context
1,000,000 tokens
最大输出
128,000 tokens
Streaming
支持
Tools
支持
Vision
支持
支持接口
/v1/messages

发送请求

/v1/messages

curl https://api.wokey.ai/v1/messages \
  -H "x-api-key: $WOKEY_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "Content-Type: application/json" \
  -d '{"model":"claude-haiku-5-5","max_tokens":1024,"messages":[{"role":"user","content":"Hello"}]}'

在客户端中使用 Claude Haiku 5.5

网关地址是 https://api.wokey.ai(OpenAI 兼容客户端通常写成 https://api.wokey.ai/v1),模型 ID 填 claude-haiku-5-5。按你使用的客户端打开对应接入文档。

常见问题

Claude Haiku 5.5 的 100K 分档怎么算?超过 100K token 输出也涨价吗?

官方价按提示长度分两档:提示(输入 + 缓存读取 + 缓存写入)在 100,000 token 以内时,输入 $0.10、输出 $0.50、缓存读取 $0.01、5 分钟缓存写入 $0.125 每百万 token;超过 100,000 时整条请求的所有计费项都按 5 倍计价(输入 $0.50、输出 $2.50)。例如 12 万 token 的提示,输出也按 $2.50 计。官方称 Haiku 4.5 约 90% 的请求在 100K 以内。Wokey 价格为提示 100K 以内输入 / 输出 $0.08 / $0.4,超过 100K 为 $0.1 / $0.5 每百万 token(官方 $0.10 / $0.50,超过 100K 为 $0.50 / $2.50),同样按提示长度分档。

Claude Haiku 5.5 和 GPT-6 Luna 哪个更好、哪个更便宜?

100K 以内两者官方价相同($0.10 / $0.50)。Haiku 5.5 在官方跑分上全面领先(GDPval-AA 1620 vs 1437、OSWorld 72.4% vs 48.9%),Artificial Analysis 指数 43 vs 38。但 GPT-6 Luna 的长上下文加价从 272K 开始、幅度只有输入 2 倍 / 输出 1.5 倍,Haiku 5.5 从 100K 开始全部 ×5;Haiku 的分词器同样文本也多约 30% token。提示短、看重质量选 Haiku 5.5;长上下文或极度看重单价选 Luna,最好用自己的任务各测一遍。

Claude Haiku 5.5 跑分怎么样?比 Haiku 4.5 强多少?

官方跑分中 Terminal-Bench 4.0 从 0% 提到 39.2%,OSWorld 2.1(离线子集)从 15.7% 提到 72.4%,GDPval-AA 从 735 提到 1620,Humanity’s Last Exam(带工具)从 18.7% 提到 57.4%。Artificial Analysis 智能指数从 17 提到 43(max 档),在同价位模型中排第二。和 Sonnet 5.5 相比仍有差距,复杂编码任务 Sonnet 5.5 明显更强。

Claude Haiku 5.5 和 Sonnet 5.5 该选哪个?

复杂的 agentic 编码、需要长时间判断的任务选 Sonnet 5.5(Terminal-Bench 70.6% vs 39.2%);分类、抽取、摘要、上下文压缩、代码库检索和子代理选 Haiku 5.5,官方单价约为 Sonnet 5.5 的 1/20。Anthropic 官方也建议把 Haiku 5.5 作为 Opus 5.5 / Sonnet 5.5 的子代理使用。

在 Claude Code 里怎么用 Claude Haiku 5.5?

Claude Code 2.1.293 起,haiku 别名在 Anthropic API 上默认指向 Haiku 5.5,默认 effort 为 medium,请先运行 claude update。通过 Wokey 等网关使用时,设置 ANTHROPIC_BASE_URL="https://api.wokey.ai"、ANTHROPIC_AUTH_TOKEN 为 Wokey API Key,并显式设置 ANTHROPIC_DEFAULT_HAIKU_MODEL="claude-haiku-5-5",后台任务和声明为 haiku 的子代理就会用 Haiku 5.5;想让没有指定模型的子代理也用它,再加 CLAUDE_CODE_SUBAGENT_MODEL="haiku"。主会话直接用 /model claude-haiku-5-5 切换。注意 Claude Code 中无法关闭 Haiku 5.5 的思考。

国内怎么调用 Claude Haiku 5.5 API?有比官方更便宜的吗?

Wokey 提供 Anthropic 原生 /v1/messages 接口,用 Wokey API Key 调用 claude-haiku-5-5 即可。Wokey 价格为提示 100K 以内输入 / 输出 $0.08 / $0.4,超过 100K 为 $0.1 / $0.5 每百万 token(官方 $0.10 / $0.50,超过 100K 为 $0.50 / $2.50)。API Key 打开「官方直连验证」后,Messages 原样转发的响应会附带 tee.proof 签名,可以在 /tools/verify 本地验签,确认收到的是官方上游返回的原文。

Claude Haiku 5.5 API 价格是多少?与官方 API 相比能节省多少?

提示(输入 + 缓存读取 + 缓存写入)在 100,000 tokens 及以内时,Wokey 输入价为 $0.08 / 1M tokens,输出价为 $0.4 / 1M tokens;官方参考价分别为 $0.1 和 $0.5。输入较官方参考价低 20%,输出低 20%。提示超过 100,000 tokens 时,整条请求按输入 $0.1、输出 $0.5 / 1M tokens 计费(官方参考价 $0.5 和 $2.5),缓存价格同样按该档计算。实际结算以请求处理时价格为准,官方定价来源见本页链接。

Claude Haiku 5.5 的 API 模型 ID 是什么?

在 Wokey 调用 Claude Haiku 5.5 时,模型 ID 是 claude-haiku-5-5。把它原样填进请求体的 model 字段,或客户端的模型设置(例如 Claude Code 的 ANTHROPIC_MODEL、Codex CLI config.toml 里的 model);GET https://api.wokey.ai/v1/models 返回的列表里也有这个 ID。

Claude Haiku 5.5 支持哪些 API 接口,如何通过 Wokey 调用?

Claude Haiku 5.5 支持 /v1/messages(Messages 请求)。将 API Base URL 设为 https://api.wokey.ai,使用 Wokey API Key,并把模型 ID 设为 canonical ID claude-haiku-5-5;可先使用 /v1/messages。本页“发送请求”部分提供了每一种支持接口的 curl 示例。

如何在 Claude Code 中使用 Claude Haiku 5.5?

Claude Code 通过 /v1/messages 调用 Claude Haiku 5.5。设置 ANTHROPIC_BASE_URL="https://api.wokey.ai"、ANTHROPIC_AUTH_TOKEN 为你的 Wokey API Key、ANTHROPIC_MODEL="claude-haiku-5-5",再启动 claude 即可。Claude Desktop 同样走 /v1/messages,两者的完整步骤见接入文档。

Claude Haiku 5.5 的上下文窗口和最大输出是多少?

Claude Haiku 5.5 的目录上下文窗口为 1,000,000 tokens,最大输出为 128,000 tokens。上下文窗口和最大输出是两个不同限制,实际请求还要满足处理时的上游约束。

Claude Haiku 5.5 的缓存读取和缓存写入如何计费?

缓存读取:Wokey 为 $0.008 / 1M tokens,官方参考为 $0.01 / 1M tokens。缓存写入:Wokey 为 $0.16 / 1M tokens,官方参考为 $0.2 / 1M tokens。

通过 Wokey 调用 Claude Haiku 5.5 和通过 OpenRouter 有什么区别?

Wokey 的 Claude Haiku 5.5 公开价为输入 $0.08 / 输出 $0.4 每 100 万 tokens,官方参考价为 $0.1 / $0.5。OpenRouter 表示推理 token 不加价,费用在购买积分时收取(银行卡 5.5%)。Wokey 只上架一组精选模型,也不提供按供应商排序的路由参数;需要更宽的模型目录时,OpenRouter 更合适。完整对比见 OpenRouter 替代方案页面。

Claude Haiku 5.5 和 Claude Haiku 4.5 的价格与上下文有什么区别?

公开价格对比中,Claude Haiku 5.5 的输入/输出价格为 $0.08 / $0.4,上下文窗口为 1,000,000 tokens;Claude Haiku 4.5 分别为 $0.2 / $1 和 200,000 tokens。这是价格与容量的事实比较,不代表模型质量排序;选择时还应结合各自支持接口和能力。

相关模型与文档

获取 API Key · claude-haiku-5-5