Kimi K3 API

Kimi K3 是 Moonshot AI 于 2026-07-17 发布的开源权重模型,2.8T 总参数、104B 激活,原生支持图片和视频输入,上下文 1M,官方价为输入 $3 / 输出 $15 每百万 token。本页汇总官方与第三方跑分、与 Claude Opus 5.5 / GLM-5.3 怎么选、reasoning_effort 怎么设、本地部署要什么硬件、调用时容易出错的地方,以及通过 Wokey 获取 API Key、调用 K3 的价格与示例。

价格对比:官方、OpenRouter 与 Wokey

每百万 token 美元价。官方与 OpenRouter 价格为 2026-09-23 人工核对,不含税;Wokey 价格读取实时价目表。

渠道输入缓存读取输出
官方 API$3$0.3$15
OpenRouter$3$0.3$15
Wokey$0.9$0.09$4.5

OpenRouter 上最低的是 Sail Research 的 fp4 量化版本(输入 $1.4989 / 输出 $10.758),量化后的输出质量可能与官方权重不同,未列入上表。

· 官方价格页 · OpenRouter 端点列表

在 Claude Code 中使用

该模型在 Wokey 上支持 /v1/messages,设置以下环境变量后启动 claude 即可。

export ANTHROPIC_BASE_URL="https://api.wokey.ai"
export ANTHROPIC_AUTH_TOKEN="$WOKEY_API_KEY"
export ANTHROPIC_MODEL="kimi-k3"

Kimi K3 API 快速接入

准备一个 Wokey API Key,完成下面三步即可发送第一条请求。

  1. 获取 API Key

    注册或登录 Wokey,进入 API 控制台,在 API Key 管理中创建并复制 Key。调用前确认账户有可用余额。

  2. 填写连接配置

    在兼容 OpenAI 的客户端中填写下方 Base URL,API Key 使用 Wokey 创建的 Key,模型选择 kimi-k3。

  3. 发送第一条请求

    将示例中的 YOUR_WOKEY_API_KEY 替换为自己的 Key,在终端执行。成功后读取 choices 中的回答,并在 API 控制台查看用量和费用。

获取 Wokey API Key · 查看 API 文档

客户端 Base URL
https://api.wokey.ai/v1
模型 ID
kimi-k3
完整请求地址
https://api.wokey.ai/v1/chat/completions

客户端 Base URL 已包含 /v1;curl 直接使用完整请求地址。

最小调用示例

export WOKEY_API_KEY="YOUR_WOKEY_API_KEY"

curl https://api.wokey.ai/v1/chat/completions \
  -H "Authorization: Bearer $WOKEY_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k3",
    "messages": [{"role": "user", "content": "Hello, Kimi!"}],
    "max_tokens": 1024
  }'

Kimi K3 要点

发布日期
2026-07-17 发布,当天上线 Kimi 网页版、Kimi Work 桌面端、Kimi Code 和 Kimi API 开放平台;完整权重于 2026-07-27 在 Hugging Face 公开
官方定位
Moonshot 称 K3 的整体表现仍落后于 Claude Fable 5 和 GPT-5.6 Sol,但在其评测中领先其他所有模型;官方推荐搭配 Kimi Code CLI 使用
模型与开源
2.8T 总参数、104B 激活的 MoE,896 个专家中每个 token 激活 16 个,基于 Kimi Delta Attention 和 Attention Residuals;权重为 moonshotai/Kimi-K3,训练时即量化为 MXFP4,全部文件约 1.56 TB,使用 Kimi K3 License
上下文与输出
1,048,576 token 上下文;max_completion_tokens 默认 131,072,最高可设到 1,048,576;原生支持文本、图片和视频输入,输出为文本
思考与 effort
思考始终开启,响应中带 reasoning_content;reasoning_effort 支持 low / high / max,默认 max(发布时只有 max);temperature、top_p 等采样参数为固定值,官方要求不传
官方价格
输入 $3 / 输出 $15 每百万 token,缓存命中 $0.30;不按上下文长度分档
API 与工具
Kimi 开放平台提供 OpenAI 兼容和 Anthropic 兼容接口,支持工具调用(tool_choice 可设为 required)、json_schema 结构化输出和上下文缓存;Wokey 提供 /v1/chat/completions 与 /v1/messages

· 来源: Moonshot · Hugging Face · K3 quickstart · Pricing · Artificial Analysis

官方跑分:Kimi K3 vs Fable 5 vs GPT-5.6 Sol vs Opus 4.8 vs GLM-5.2

数据来自 Moonshot 在 Hugging Face 发布的模型卡,是厂商自测结果;“—”表示未公布。对比对象是 K3 发布时(2026-07)的模型,表里没有之后发布的 Claude Opus 5.5 和 GLM-5.3,与它们的对比见下方「怎么选」。

基准Kimi K3Fable 5GPT-5.6 SolOpus 4.8GLM-5.2
GPQA Diamond93.5%92.6%94.1%91.0%91.2%
HLE-Full (tools)56.0%63.0%58.0%57.9%—
DeepSWE v1.167.5%70.0%73.0%59.0%46.2%
Terminal-Bench 2.188.3%88.0%88.8%84.6%82.7%
ProgramBench77.8%76.8%77.6%71.9%63.7%
SWE-Marathon (pre-v1.1)42.0%35.0%39.0%40.0%13.0%
BrowseComp91.2%88.0%90.4%84.3%—
Toolathlon-Verified76.5%77.9%74.9%76.2%59.9%
OSWorld-Verified84.8%85.0%83.0%83.4%—
GDPval-AA v216861747173615931510
Video-MME (w/ subs)90.0%—89.5%86.0%—

K3 的成绩都在 reasoning_effort=max、temperature=1.0 下取得;Fable 5 一列为启用回退时的成绩,模型卡中的 GPT-5.5 一列未列出,HLE-Full 一行为带工具的成绩。DeepSWE、Terminal-Bench 2.1 和 ProgramBench 中 K3 用的是 Kimi Code 环境,其他模型的分数多取自公开榜单或各自最好的环境,条件不完全相同:在 DeepSWE 官方榜单的 mini-SWE-agent 环境下,K3 为 67.3%。SWE-Marathon 一行用的是 v1.1 定版前、按 H20 重新校准的任务集;Z.ai 表中 K3 的 v1.1 成绩为 48.1%。

怎么选:Kimi K3、Claude Opus 5.5 还是 GLM-5.3

对比 Claude Opus 5.5

Opus 5.5 于 2026-09-22 发布,比 K3 晚两个月。Artificial Analysis 智能指数 v4.3.2 中,Opus 5.5(max)为 58 分,K3(max)为 44 分,差距明显。K3 官方价 $3 / $15,只比 Opus 5.5 的 $4 / $20 低 25%;但 Opus 5.5 跑完整套指数用了 2.6 亿输出 token,K3 为 1.6 亿,按官方价每任务 $5.98 对 $2.00,K3 约为三分之一。输出速度 Opus 5.5 约 92 token/s,K3 约 34 token/s。最难的编码、长程 agent 和要求一次做对的任务选 Opus 5.5;大批量、对成本敏感、需要视频输入或要自部署时选 K3。

对比 GLM-5.3

Artificial Analysis 智能指数中两者几乎持平:GLM-5.3(max)45 分,K3 44 分,每任务成本也几乎相同($2.01 vs $2.00)。GLM-5.3 官方价 $1.4 / $4.4,不到 K3 的一半,但输出更长(跑完指数用了 2.1 亿 token,K3 为 1.6 亿),输出速度约为 K3 的两倍(约 66 vs 34 token/s)。Z.ai 的 GLM-5.3 发布页同时列出了两者的成绩:DeepSWE v1.1 接近(66.9% vs 67.5%),GLM-5.3 在 Terminal Bench 3.0 领先(28.3% vs 17.4%),K3 在 SWE-Marathon v1.1(48.1% vs 42.5%)和 Toolathlon(76.5% vs 73.0%)领先。纯文本编码两者都可以;需要图片或视频输入选 K3,GLM-5.3 只支持文本;要自部署时,GLM-5.3(753B 总参数)比 K3(2.8T)容易得多。

Effort 怎么设

K3 只有 low、high、max 三档,默认 max,思考不能关闭。Artificial Analysis 测得 max 为 44 分、每任务 $2.00,low 为 30 分、$1.15:low 每任务便宜约 40%,但少了 14 分。编码和 agent 任务用默认的 max;high 暂无第三方数据,可以在自己的任务上和 max 对比后再定;low 只适合简单问答和格式转换。推理 token 按输出价计费,effort 越高输出越多。

Kimi 官方文档

第三方与社区评价

  • Artificial Analysis: 智能指数 v4.3.2 中 max 为 44 分、low 为 30 分;跑完整套指数用了 1.6 亿输出 token,每任务 $2.00,输出速度约 34 token/s,首字延迟约 4.5 秒。发布当天按当时的指数版本为 57 分、排第 3,与 Claude Opus 4.8、GPT-5.5 相当,落后于 Fable 5 和 GPT-5.6 Sol;同时指出它的幻觉率从 K2.6 的 39% 升到 51%。Wokey 各计费项均为官方价的 30%,同样的任务 max 档约 $0.60,low 档约 $0.34。
  • Fireworks: Fireworks 自己也提供 K3 推理服务。它在约 1,030 个 agent 任务上把 K3 和 Claude Fable 5 放进同一套 agent 循环:SWE 类任务通过率 92.4% 对 92.6%,基本持平;但 K3 平均每个任务约 55 轮、130 万 token,Fable 5 约 21 轮、13 万 token。
  • Hacker News(2107 分讨论): 讨论最多的是价格:不少人觉得 $3 / $15 对开源权重模型偏贵,也有人认为如果它确实只落后 Fable 和 Sol,这个价格说得过去。其次是思考长度:有人抱怨它想得太久、内容反复;Simon Willison 的鹈鹕测试输出 16,658 token,其中 13,241 个是推理 token,花了约 $0.25;也有人测得它的推理 token 只有 K2.6 的约 60%。

在 Claude Code 里使用 K3 与调用注意事项

以下要求来自 Kimi 官方的 K3 快速开始文档,以及 Wokey 线上排查过的问题。从 K2.x 切换到 kimi-k3,或第一次接入前,先检查这几项。

  • 思考不能关闭,响应中始终带 reasoning_content。从 K2.x 迁移时,把原来的 thinking 参数换成顶层的 reasoning_effort(low / high / max)。
  • 多轮对话和工具调用要把 API 返回的完整 assistant 消息原样传回,包括 reasoning_content 和 tool_calls;只传回 content 会丢掉之前的推理内容。
  • temperature、top_p、n、presence_penalty、frequency_penalty 固定为 1.0、0.95、1、0、0,官方要求在请求中省略这些字段。
  • 图片不能用公网 URL:image_url 里要放 base64 的 data URL(如 data:image/png;base64,...),直接给 https 图片地址会返回 400 unsupported image url;视频同样用 base64。官方「先上传文件、再用 ms://<file_id> 引用」的方式,目前不能通过 Wokey 使用。
  • max_completion_tokens 默认 131,072,最高可设到 1,048,576。推理 token 按输出计费,默认的 max 档输出很长,按输出计费的预算要留足余量。
  • 设置 stop 序列时,K3 可能在推理阶段就被截断,返回 finish_reason 为 stop、content 为空的结果。这是上游行为,Wokey 不会删除正文;依赖 stop 的流程先在自己的任务上验证。
  • 在 Claude Code 里使用:Wokey 的 kimi-k3 支持 /v1/messages,把 ANTHROPIC_BASE_URL 设为 https://api.wokey.ai、ANTHROPIC_AUTH_TOKEN 填 Wokey API Key、ANTHROPIC_MODEL 设为 kimi-k3 即可,价格为输入 $0.90 / 输出 $4.50 每百万 token。Moonshot 官方推荐的 agent 框架是 Kimi Code CLI;OpenCode 等支持 OpenAI 接口的客户端用 /v1/chat/completions。

带图片的请求体示例(/v1/chat/completions)

{
  "model": "kimi-k3",
  "reasoning_effort": "high",
  "messages": [{
    "role": "user",
    "content": [
      { "type": "image_url", "image_url": { "url": "data:image/png;base64,iVBORw0KGgo..." } },
      { "type": "text", "text": "Find the layout bug in this screenshot" }
    ]
  }]
}
模型 ID
kimi-k3
供应商
moonshot, volcengine
供应状态
当前可调用

目录价格快照

价格单位为每 100 万 tokens;实际结算以请求处理时价格为准。

计费项Wokey官方参考节省幅度
Input$0.9$370%
Output$4.5$1570%
Cache read$0.09$0.370%
Cache write———

官方价格来源: https://platform.kimi.ai/docs/pricing/chat-k3

模型能力

Context
1,048,576 tokens
最大输出
1,048,576 tokens
Streaming
支持
Tools
支持
Vision
支持
支持接口
/v1/chat/completions · /v1/messages

发送请求

/v1/chat/completions

curl https://api.wokey.ai/v1/chat/completions \
  -H "Authorization: Bearer $WOKEY_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"kimi-k3","messages":[{"role":"user","content":"Hello"}]}'

/v1/messages

curl https://api.wokey.ai/v1/messages \
  -H "x-api-key: $WOKEY_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "Content-Type: application/json" \
  -d '{"model":"kimi-k3","max_tokens":1024,"messages":[{"role":"user","content":"Hello"}]}'

在客户端中使用 Kimi K3

网关地址是 https://api.wokey.ai(OpenAI 兼容客户端通常写成 https://api.wokey.ai/v1),模型 ID 填 kimi-k3。按你使用的客户端打开对应接入文档。

典型调用样本

以下用量来自线上已完成的 Kimi K3 调用,首次尝试成功,并已核对实际账单。

总输入
76023
输出
574
输入缓存占比
99.3%
本次调用耗时
25.60 s

Chat Completions usage

根据该次调用的结算记录整理为接口字段示例;prompt_tokens 为输入总量,已包含缓存读取。

{
  "model": "kimi-k3",
  "usage": {
    "prompt_tokens": 76023,
    "prompt_tokens_details": {
      "cached_tokens": 75520
    },
    "completion_tokens": 574,
    "total_tokens": 76597
  }
}

Token 对账

以下使用这次调用的最终计费单价,按每 100 万 tokens 计算。

计费项Token 数当次单价 / 1M
普通输入503$0.9
缓存读取75520$0.09
输出574$4.5
实际账单
$0.009833

费用 = 各项 Token 数 × 对应单价 ÷ 1,000,000,汇总后保留 6 位小数。

本次调用来源

该次调用由 Volcengine 渠道提供,出口记录指向 ark.cn-beijing.volces.com,使用 API Key 授权;计量来源为上游,返回 HTTP 200。

了解 Provider Node · 查看接入文档

如何核对 Prompt Cache

  1. 保持长提示词的公共前缀一致,按所用接口的缓存规则复用上下文。
  2. 检查 prompt_tokens_details.cached_tokens;数值为 0 表示该次调用没有记录缓存读取。
  3. 普通输入量 = prompt_tokens − 缓存读取量;分别乘对应单价,再加输出费用。

常见问题

如何获取调用 Kimi K3 的 API Key?

通过 Wokey 调用 Kimi K3,使用 Wokey API Key。注册或登录后进入 /api 控制台,在 API Key 管理中创建并复制 Key,确认账户有可用余额后即可调用。

Kimi K3 的 Base URL 和模型 ID 怎么填?

在兼容 OpenAI 的客户端中,Base URL 填写 https://api.wokey.ai/v1,模型 ID 填写 kimi-k3。HTTP 请求完整地址为 https://api.wokey.ai/v1/chat/completions,使用 Authorization: Bearer 传入 Wokey API Key。

Kimi 网页订阅和 Wokey API Key 如何使用?

本页示例使用 Wokey 账户创建的 API Key 和 Wokey 网关,费用从 Wokey 账户余额按调用用量结算。Kimi 网页订阅及其他平台的 Key 由各自平台管理。

Kimi K3 和 Claude Opus 5.5 哪个好?

Artificial Analysis 智能指数 v4.3.2 中 Opus 5.5(max)为 58 分,K3(max)为 44 分,Opus 5.5 明显更强,输出速度也约为 K3 的 2.7 倍。但 K3 每个指数任务只要 $2.00,约为 Opus 5.5($5.98)的三分之一,官方单价 $3 / $15 也低于 Opus 5.5 的 $4 / $20。追求最高质量、要求一次做对选 Opus 5.5;大批量调用、预算敏感、需要视频输入或要自部署选 K3。

Kimi K3 和 GLM-5.3 哪个好?

Artificial Analysis 智能指数中 GLM-5.3(max)为 45 分,K3 为 44 分,每任务成本几乎相同($2.01 vs $2.00)。GLM-5.3 官方价 $1.4 / $4.4,不到 K3($3 / $15)的一半,输出速度约为 K3 的两倍。Z.ai 的 GLM-5.3 发布页中,GLM-5.3 在 Terminal Bench 3.0 领先,K3 在 SWE-Marathon 和 Toolathlon 领先,DeepSWE 两者接近。需要图片或视频输入选 K3,纯文本编码两者都可以。

Kimi K3 能本地部署吗?需要什么硬件?

能。权重已在 Hugging Face 公开(moonshotai/Kimi-K3),原生 MXFP4,全部文件约 1.56 TB,使用 Kimi K3 License,商用前请阅读许可证。vLLM 官方配方要求单机至少 8 张 GB300 或 8 张 MI355X/MI350X;Unsloth 最小的 1-bit 动态量化(UD-IQ1_S)也有 594 GB,需要约 610 GB 内存加显存。社区有人在 MacBook Pro 上从四块 SSD 流式读取权重,跑到约 1 token/s,只能算实验。没有这类硬件时,用官方 API 或 Wokey 等按 token 计费的渠道更实际。

Kimi K3 的 reasoning_effort 怎么设?能关闭思考吗?

不能关闭思考。K3 的 reasoning_effort 只有 low、high、max,默认 max;从 K2.x 迁移时,把原来的 thinking 参数换成 reasoning_effort。Artificial Analysis 测得 max 为 44 分、每任务 $2.00,low 为 30 分、$1.15。编码和 agent 任务用 max,简单任务用 low,high 可以在自己的任务上和 max 对比后再定。

Kimi K3 为什么返回 unsupported image url?

Kimi 的视觉输入不接受公网图片地址,即使图片在浏览器里能正常打开,上游也会返回 400 unsupported image url。请把图片下载后转成 base64 的 data URL(如 data:image/png;base64,...)再放进 image_url,视频同样用 base64。Wokey 不会替你下载远程图片再转码,原样重试同一个 URL 仍会失败。

Kimi K3 API 价格是多少?与官方 API 相比能节省多少?

Wokey 输入价为 $0.9 / 1M tokens,输出价为 $4.5 / 1M tokens;官方参考价分别为 $3 和 $15。输入较官方参考价低 70%,输出低 70%。实际结算以请求处理时价格为准,官方定价来源见本页链接。

Kimi K3 支持哪些 API 接口,如何通过 Wokey 调用?

Kimi K3 支持 /v1/chat/completions(Chat Completions 请求)、/v1/messages(Messages 请求)。将 API Base URL 设为 https://api.wokey.ai,使用 Wokey API Key,并把模型 ID 设为 canonical ID kimi-k3;可先使用 /v1/chat/completions。本页“发送请求”部分提供了每一种支持接口的 curl 示例。

如何在 Claude Code 中使用 Kimi K3?

Claude Code 通过 /v1/messages 调用 Kimi K3。设置 ANTHROPIC_BASE_URL="https://api.wokey.ai"、ANTHROPIC_AUTH_TOKEN 为你的 Wokey API Key、ANTHROPIC_MODEL="kimi-k3",再启动 claude 即可。Claude Desktop 同样走 /v1/messages,两者的完整步骤见接入文档。

Kimi K3 的上下文窗口和最大输出是多少?

Kimi K3 的目录上下文窗口为 1,048,576 tokens,最大输出为 1,048,576 tokens。上下文窗口和最大输出是两个不同限制,实际请求还要满足处理时的上游约束。

Kimi K3 的缓存读取和缓存写入如何计费?

缓存读取:Wokey 为 $0.09 / 1M tokens,官方参考为 $0.3 / 1M tokens。缓存写入:厂商未公布独立计费项,Wokey 公开价格也显示 —。

通过 Wokey 调用 Kimi K3 和通过 OpenRouter 有什么区别?

Wokey 的 Kimi K3 公开价为输入 $0.9 / 输出 $4.5 每 100 万 tokens,官方参考价为 $3 / $15。OpenRouter 表示推理 token 不加价,费用在购买积分时收取(银行卡 5.5%)。Wokey 只上架一组精选模型,也不提供按供应商排序的路由参数;需要更宽的模型目录时,OpenRouter 更合适。完整对比见 OpenRouter 替代方案页面。

Kimi K3 和 Kimi K2.8 Preview 的价格与上下文有什么区别?

公开价格对比中,Kimi K3 的输入/输出价格为 $0.9 / $4.5,上下文窗口为 1,048,576 tokens;Kimi K2.8 Preview 分别为 $0.3 / $1.2 和 1,048,576 tokens。这是价格与容量的事实比较,不代表模型质量排序;选择时还应结合各自支持接口和能力。

相关模型与文档

获取 API Key · kimi-k3