Kimi K3 API

Kimi K3 — модель с открытыми весами, которую Moonshot AI выпустила 2026-07-17: 2.8T параметров всего и 104B активных, нативный ввод изображений и видео, контекстное окно 1M. Официальная цена — $3 / $15 за 1 млн входных / выходных токенов. На этой странице — официальные и независимые бенчмарки, сравнение с Claude Opus 5.5 и GLM-5.3, настройка reasoning_effort, железо для локального запуска, правила запросов, на которых чаще всего спотыкаются интеграции, а также цены и примеры для API-ключа Wokey.

Сравнение цен: официальный API, OpenRouter и Wokey

Цены в USD за 1 млн токенов. Тарифы официального API и OpenRouter проверены вручную 2026-09-23, без учёта налогов; цена Wokey берётся из актуального прайс-листа.

КаналВходныеЧтение из кэшаВыходные
Официальный API$3$0.3$15
OpenRouter$3$0.3$15
Wokey$0.9$0.09$4.5

Самый дешёвый хостинг на OpenRouter — Sail Research с квантованием fp4 ($1.4989 за входные / $10.758 за выходные). Ответы квантованной версии могут отличаться от официальных весов, поэтому в таблицу она не включена.

· Официальная страница цен · Список эндпоинтов OpenRouter

Использование в Claude Code

На Wokey эта модель поддерживает /v1/messages. Задайте эти переменные окружения и запустите claude.

export ANTHROPIC_BASE_URL="https://api.wokey.ai"
export ANTHROPIC_AUTH_TOKEN="$WOKEY_API_KEY"
export ANTHROPIC_MODEL="kimi-k3"

Kimi K3 API: быстрый старт

Получите API-ключ Wokey и выполните три шага, чтобы отправить первый запрос.

  1. Получите API-ключ

    Зарегистрируйтесь или войдите в Wokey, откройте консоль API и в разделе управления API-ключами создайте и скопируйте ключ. Перед вызовами проверьте, что на балансе есть средства.

  2. Настройте клиент

    Укажите base URL ниже в OpenAI-совместимом клиенте, введите API-ключ Wokey и выберите модель kimi-k3.

  3. Отправьте первый запрос

    Замените YOUR_WOKEY_API_KEY в примере на свой ключ и выполните команду в терминале. Ответ будет в choices; использование и списания можно посмотреть в консоли API.

Получить API-ключ Wokey · Документация API

Base URL для клиента
https://api.wokey.ai/v1
ID модели
kimi-k3
Полный URL запроса
https://api.wokey.ai/v1/chat/completions

Base URL для клиента уже содержит /v1. В примере curl используется полный URL запроса.

Минимальный запрос

export WOKEY_API_KEY="YOUR_WOKEY_API_KEY"

curl https://api.wokey.ai/v1/chat/completions \
  -H "Authorization: Bearer $WOKEY_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k3",
    "messages": [{"role": "user", "content": "Hello, Kimi!"}],
    "max_tokens": 1024
  }'

Kimi K3: главное

Дата выхода
2026-07-17 — в первый же день в веб-версии Kimi, десктопном приложении Kimi Work, Kimi Code и на API-платформе Kimi; полные веса опубликованы на Hugging Face 2026-07-27
Позиционирование
По словам Moonshot, в целом K3 пока уступает Claude Fable 5 и GPT-5.6 Sol, но в её оценках опередила все остальные модели; в качестве агентного фреймворка Moonshot рекомендует Kimi Code CLI
Модель и веса
MoE на 2.8T параметров, из них 104B активных: каждый токен маршрутизируется в 16 из 896 экспертов, архитектура построена на Kimi Delta Attention и Attention Residuals; веса — moonshotai/Kimi-K3, квантованы в MXFP4 ещё при обучении, общий объём около 1.56 TB, лицензия Kimi K3 License
Контекст и вывод
Контекст 1,048,576 токенов; max_completion_tokens по умолчанию 131,072, максимум — 1,048,576; нативный ввод текста, изображений и видео, вывод — текст
Рассуждения и effort
Режим рассуждений включён всегда, ответы содержат reasoning_content; reasoning_effort принимает low / high / max, по умолчанию max (на старте был только max); temperature, top_p и другие параметры сэмплирования зафиксированы, передавать их не нужно
Официальная цена
$3 / $15 за 1 млн входных / выходных токенов, $0.30 при попадании в кэш; без ценовых ступеней по длине контекста
API и инструменты
Платформа Kimi предоставляет OpenAI- и Anthropic-совместимые API с вызовом инструментов (tool_choice можно задать как required), структурированным выводом json_schema и кэшированием контекста; Wokey обслуживает /v1/chat/completions и /v1/messages

· Источники: Moonshot · Hugging Face · K3 quickstart · Pricing · Artificial Analysis

Официальные бенчмарки: Kimi K3 vs Fable 5 vs GPT-5.6 Sol vs Opus 4.8 vs GLM-5.2

Данные из карточки модели Moonshot на Hugging Face; это результаты, заявленные самим вендором, а «—» означает, что результат не опубликован. Для сравнения взяты модели, актуальные на момент выхода K3 (2026-07), поэтому вышедших позже Claude Opus 5.5 и GLM-5.3 в таблице нет — сравнение с ними см. ниже в разделе «Что выбрать».

БенчмаркKimi K3Fable 5GPT-5.6 SolOpus 4.8GLM-5.2
GPQA Diamond93.5%92.6%94.1%91.0%91.2%
HLE-Full (tools)56.0%63.0%58.0%57.9%—
DeepSWE v1.167.5%70.0%73.0%59.0%46.2%
Terminal-Bench 2.188.3%88.0%88.8%84.6%82.7%
ProgramBench77.8%76.8%77.6%71.9%63.7%
SWE-Marathon (pre-v1.1)42.0%35.0%39.0%40.0%13.0%
BrowseComp91.2%88.0%90.4%84.3%—
Toolathlon-Verified76.5%77.9%74.9%76.2%59.9%
OSWorld-Verified84.8%85.0%83.0%83.4%—
GDPval-AA v216861747173615931510
Video-MME (w/ subs)90.0%—89.5%86.0%—

Все результаты K3 получены с reasoning_effort=max и temperature=1.0. Столбец Fable 5 — прогон с fallback, столбец GPT-5.5 из карточки опущен, строка HLE-Full — результат с инструментами. На DeepSWE, Terminal-Bench 2.1 и ProgramBench K3 запускалась в окружении Kimi Code, тогда как большинство остальных результатов взято из публичных лидербордов или из лучшего окружения для каждой модели, так что условия различаются: в окружении mini-SWE-agent официального лидерборда DeepSWE K3 набирает 67.3%. Строка SWE-Marathon — набор задач до релиза v1.1, перекалиброванный на H20; в таблице Z.ai у K3 на v1.1 — 48.1%.

Что выбрать: Kimi K3, Claude Opus 5.5 или GLM-5.3

Сравнение с Claude Opus 5.5

Opus 5.5 вышла 2026-09-22, через два месяца после K3. В Artificial Analysis Intelligence Index v4.3.2 Opus 5.5 набирает 58 на max, а K3 — 44: разрыв заметный. K3 стоит $3 / $15, всего на 25% дешевле, чем $4 / $20 у Opus 5.5, но Opus 5.5 израсходовала на весь индекс 260 млн выходных токенов против 160 млн у K3, поэтому по официальным ценам задача обходится в $5.98 против $2.00 — у K3 примерно втрое дешевле. Скорость вывода — около 92 токенов/с у Opus 5.5 и около 34 у K3. Opus 5.5 — для самого сложного кода, долгих агентных задач и работы, которую нужно сделать правильно с первого раза; K3 — для больших объёмов, жёсткого бюджета, ввода видео или самостоятельного развёртывания.

Сравнение с GLM-5.3

В Artificial Analysis Intelligence Index модели идут вровень: GLM-5.3 набирает 45 на max, K3 — 44, при почти одинаковой стоимости задачи ($2.01 vs $2.00). GLM-5.3 стоит $1.4 / $4.4 — меньше половины цены K3, — но пишет более длинные ответы (210 млн токенов на весь индекс против 160 млн) и работает примерно вдвое быстрее (около 66 vs 34 токенов/с). На странице запуска GLM-5.3 от Z.ai приведены результаты обеих: на DeepSWE v1.1 они близки (66.9% vs 67.5%), GLM-5.3 лидирует на Terminal Bench 3.0 (28.3% vs 17.4%), а K3 — на SWE-Marathon v1.1 (48.1% vs 42.5%) и Toolathlon (76.5% vs 73.0%). Для кода с чисто текстовым вводом подойдёт любая; если нужен ввод изображений или видео, берите K3 — GLM-5.3 работает только с текстом; для самостоятельного развёртывания GLM-5.3 (753B параметров) намного проще, чем K3 (2.8T).

Как выбрать effort

У K3 только три уровня — low, high и max, по умолчанию max, и отключить рассуждения нельзя. По замерам Artificial Analysis, max даёт 44 балла при $2.00 за задачу, а low — 30 баллов при $1.15: low примерно на 40% дешевле в расчёте на задачу, но теряет 14 баллов. Для кода и агентов используйте max по умолчанию; независимых данных по high пока нет, так что сравните его с max на своих задачах; low оставьте для простых вопросов и преобразования форматов. Токены рассуждений тарифицируются по цене выходных, поэтому чем выше effort, тем больше вывода.

Документация Kimi по effort

Независимые оценки и мнения сообщества

  • Artificial Analysis: В Intelligence Index v4.3.2 модель набирает 44 на max и 30 на low; на весь индекс ушло 160 млн выходных токенов, $2.00 за задачу, скорость вывода — около 34 токенов/с, время до первого токена — около 4.5 секунды. В день выхода, по версии индекса того времени, она набрала 57 и заняла третье место — наравне с Claude Opus 4.8 и GPT-5.5, позади Fable 5 и GPT-5.6 Sol; при этом доля галлюцинаций выросла с 39% у K2.6 до 51%. Каждая тарифная позиция Wokey составляет 30% от официальной цены, так что та же задача обойдётся примерно в $0.60 на max и $0.34 на low.
  • Fireworks: Fireworks, которая тоже предоставляет инференс K3, сравнила её с Claude Fable 5 в одном и том же агентном цикле примерно на 1,030 агентных задачах. На SWE-задачах K3 прошла 92.4%, а Fable 5 — 92.6%, практически вровень, но K3 тратила на задачу в среднем около 55 ходов и 1.3 млн токенов против 21 хода и 130K токенов у Fable 5.
  • Hacker News (обсуждение на 2,107 баллов): Больше всего обсуждали цену: многим $3 / $15 показалось дорого для модели с открытыми весами, другие считают цену оправданной, если K3 действительно уступает только Fable и Sol. Второй темой стала длина рассуждений: кто-то жаловался, что модель думает слишком долго и повторяется; в тесте с пеликаном от Simon Willison она выдала 16,658 выходных токенов, из них 13,241 — рассуждения, примерно на $0.25; другой комментатор насчитал около 60% от объёма токенов рассуждений K2.6.

Как использовать K3 в Claude Code и что проверить в запросах

Эти правила взяты из руководства по быстрому старту K3 от Kimi и из проблем, которые мы разбирали в продакшене Wokey. Проверьте их перед переходом с K2.x на kimi-k3 или при первой интеграции.

  • Отключить рассуждения нельзя, ответы всегда содержат reasoning_content. При миграции с K2.x замените старый параметр thinking на reasoning_effort верхнего уровня (low / high / max).
  • В многоходовых диалогах и при вызове инструментов передавайте обратно полное сообщение assistant, которое вернул API, включая reasoning_content и tool_calls; если вернуть только content, предыдущие рассуждения потеряются.
  • temperature, top_p, n, presence_penalty и frequency_penalty зафиксированы на значениях 1.0, 0.95, 1, 0 и 0, и Kimi просит не передавать их в запросах.
  • Изображения нельзя передавать публичными URL: кладите в image_url data URL в base64, например data:image/png;base64,..., потому что ссылка https на изображение вернёт 400 unsupported image url; видео тоже передаётся в base64. Схема Kimi «загрузить файл, затем сослаться на него через ms://<file_id>» через Wokey пока недоступна.
  • max_completion_tokens по умолчанию 131,072, максимум — 1,048,576. Токены рассуждений тарифицируются как выходные, а уровень max по умолчанию даёт длинный вывод, так что закладывайте запас в бюджет на выходные токены.
  • Если задана stop-последовательность, K3 может оборваться ещё на этапе рассуждений и вернуть finish_reason stop с пустым content. Это поведение на стороне upstream, Wokey текст не удаляет, поэтому сценарии, зависящие от stop, сначала проверьте на своих задачах.
  • Использование в Claude Code: kimi-k3 в Wokey поддерживает /v1/messages, поэтому задайте ANTHROPIC_BASE_URL равным https://api.wokey.ai, ANTHROPIC_AUTH_TOKEN — ваш API-ключ Wokey, ANTHROPIC_MODEL — kimi-k3; цена — $0.90 / $4.50 за 1 млн входных / выходных токенов. Moonshot рекомендует в качестве агентного фреймворка Kimi Code CLI, а OpenCode и другие OpenAI-совместимые клиенты используют /v1/chat/completions.

Тело запроса с изображением (/v1/chat/completions)

{
  "model": "kimi-k3",
  "reasoning_effort": "high",
  "messages": [{
    "role": "user",
    "content": [
      { "type": "image_url", "image_url": { "url": "data:image/png;base64,iVBORw0KGgo..." } },
      { "type": "text", "text": "Find the layout bug in this screenshot" }
    ]
  }]
}
ID модели
kimi-k3
Поставщики
moonshot, volcengine
Статус поставок
Доступна для вызова

Текущие цены каталога

Цены указаны за 1 млн токенов; списание идёт по цене на момент обработки запроса.

ПозицияWokeyОфициальная ценаЭкономия
Input$0.9$370%
Output$4.5$1570%
Cache read$0.09$0.370%
Cache write———

Источник официальной цены: https://platform.kimi.ai/docs/pricing/chat-k3

Возможности модели

Context
1,048,576 tokens
Максимальный вывод
1,048,576 tokens
Streaming
Поддерживается
Tools
Поддерживается
Vision
Поддерживается
Поддерживаемые форматы API
/v1/chat/completions · /v1/messages

Отправить запрос

/v1/chat/completions

curl https://api.wokey.ai/v1/chat/completions \
  -H "Authorization: Bearer $WOKEY_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"kimi-k3","messages":[{"role":"user","content":"Hello"}]}'

/v1/messages

curl https://api.wokey.ai/v1/messages \
  -H "x-api-key: $WOKEY_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "Content-Type: application/json" \
  -d '{"model":"kimi-k3","max_tokens":1024,"messages":[{"role":"user","content":"Hello"}]}'

Kimi K3 в ваших инструментах

Адрес шлюза — https://api.wokey.ai (OpenAI-совместимые клиенты обычно принимают https://api.wokey.ai/v1), ID модели — kimi-k3. Откройте руководство для своего клиента.

Пример реального вызова

Эти данные об использовании взяты из завершённого вызова Kimi K3, который прошёл с первой попытки и был сверен со счётом.

Всего входных
76023
Выходные
574
Доля кэша во входных
99.3%
Длительность вызова
25.60 s

Chat Completions usage

Составлено по записи о списании в виде полей API. prompt_tokens — все входные токены, включая кэшированные.

{
  "model": "kimi-k3",
  "usage": {
    "prompt_tokens": 76023,
    "prompt_tokens_details": {
      "cached_tokens": 75520
    },
    "completion_tokens": 574,
    "total_tokens": 76597
  }
}

Сверка токенов

Ниже — итоговые цены за 1 млн токенов, зафиксированные для этого вызова.

СтатьяТокеныЦена этого вызова / 1M
Обычные входные503$0.9
Чтение из кэша75520$0.09
Выходные574$4.5
Списано
$0.009833

Стоимость = сумма токенов × их цена ÷ 1,000,000, после суммирования округляется до шести знаков.

Источник этого вызова

Этот вызов прошёл через канал Volcengine на ark.cn-beijing.volces.com с авторизацией API Key. Использование учтено на стороне upstream, запрос вернул HTTP 200.

Об узле провайдера · Документация по подключению

Как проверить Prompt Cache

  1. Держите общий префикс длинных промптов неизменным и переиспользуйте контекст по правилам кэширования выбранного API.
  2. Проверьте prompt_tokens_details.cached_tokens; ноль означает, что для этого вызова чтение из кэша не зафиксировано.
  3. Обычные входные = prompt_tokens минус кэшированные токены. Посчитайте каждую группу по своей цене и добавьте стоимость выходных токенов.

Частые вопросы

Как получить API-ключ для Kimi K3?

Чтобы вызывать Kimi K3 через Wokey, используйте API-ключ Wokey. Зарегистрируйтесь или войдите, откройте консоль /api и в разделе управления API-ключами создайте и скопируйте ключ. Перед вызовами убедитесь, что на балансе аккаунта есть средства.

Какой base URL и ID модели указывать для Kimi K3?

В OpenAI-совместимом клиенте укажите base URL https://api.wokey.ai/v1 и ID модели kimi-k3. Полный HTTP-эндпоинт — https://api.wokey.ai/v1/chat/completions. Передавайте API-ключ Wokey в заголовке Authorization: Bearer.

Как соотносятся веб-подписка Kimi и API-ключ Wokey?

В этом примере используется API-ключ, созданный в вашем аккаунте Wokey, и шлюз Wokey. Использование списывается с баланса Wokey. Веб-подписками Kimi и ключами других платформ управляют сами эти платформы.

Kimi K3 vs Claude Opus 5.5: что лучше?

В Artificial Analysis Intelligence Index v4.3.2 Opus 5.5 набирает 58 на max, а K3 — 44, так что Opus 5.5 заметно сильнее и к тому же выдаёт токены примерно в 2.7 раза быстрее. Зато задача из индекса на K3 стоит $2.00 — примерно треть от $5.98 у Opus 5.5, а прайс $3 / $15 ниже, чем $4 / $20 у Opus 5.5. Выбирайте Opus 5.5, когда нужны максимальное качество и результат с первого раза; K3 — для больших объёмов запросов, жёсткого бюджета, ввода видео или самостоятельного развёртывания.

Kimi K3 vs GLM-5.3: что лучше?

В Artificial Analysis Intelligence Index GLM-5.3 набирает 45 на max, K3 — 44, при почти одинаковой стоимости задачи ($2.01 vs $2.00). GLM-5.3 стоит $1.4 / $4.4 — меньше половины от $3 / $15 у K3 — и выдаёт токены примерно вдвое быстрее. На странице запуска GLM-5.3 от Z.ai GLM-5.3 лидирует на Terminal Bench 3.0, K3 — на SWE-Marathon и Toolathlon, а на DeepSWE они близки. Если нужен ввод изображений или видео, берите K3; для кода с текстовым вводом подойдёт любая.

Можно ли запустить Kimi K3 локально и какое железо для этого нужно?

Да. Веса опубликованы на Hugging Face (moonshotai/Kimi-K3) в нативном MXFP4, общий объём около 1.56 TB, лицензия Kimi K3 License — перед коммерческим использованием прочитайте её. Официальный рецепт vLLM требует как минимум 8 GPU GB300 или 8 MI355X/MI350X на одной машине, а самый маленький динамический 1-битный квант от Unsloth (UD-IQ1_S) всё равно занимает 594 GB и требует около 610 GB RAM и VRAM в сумме. Один проект сообщества стримит веса с четырёх SSD на MacBook Pro со скоростью около 1 токена/с — это эксперимент, а не рабочая конфигурация. Без такого железа практичнее официальный API или канал с оплатой за токены, например Wokey.

Как настроить reasoning_effort в Kimi K3 и можно ли отключить рассуждения?

Отключить рассуждения нельзя. reasoning_effort в K3 принимает только low, high и max, по умолчанию max; при миграции с K2.x замените старый параметр thinking на reasoning_effort. По замерам Artificial Analysis, max даёт 44 балла при $2.00 за задачу, а low — 30 баллов при $1.15. Используйте max для кода и агентов, low — для простых задач, а high перед переходом сравните с max на своих задачах.

Почему Kimi K3 возвращает unsupported image url?

Визуальный ввод Kimi не принимает публичные URL изображений, поэтому upstream возвращает 400 unsupported image url, даже если картинка нормально открывается в браузере. Скачайте изображение, преобразуйте его в data URL в base64, например data:image/png;base64,..., и передайте в image_url; видео тоже передаётся в base64. Wokey не скачивает удалённые изображения и не перекодирует их за вас, так что повторный запрос с тем же URL снова завершится ошибкой.

Сколько стоит API Kimi K3 и насколько это дешевле официального API?

Wokey берёт $0.9 за 1 млн входных токенов и $4.5 за 1 млн выходных; официальные справочные цены — $3 и $15. Это на 70% дешевле для входных токенов и на 70% — для выходных. Расчёт ведётся по цене на момент обработки запроса; ссылка на официальный прайс поставщика есть на этой странице.

Какие форматы API поддерживает Kimi K3 и как вызвать модель через Wokey?

Kimi K3 поддерживает /v1/chat/completions (запросы Chat Completions) и /v1/messages (запросы Messages). Укажите базовый URL API https://api.wokey.ai, авторизуйтесь API-ключом Wokey и используйте канонический ID модели kimi-k3; начать можно с /v1/chat/completions. В разделе «Отправить запрос» есть пример curl для каждого поддерживаемого формата API.

Как использовать Kimi K3 в Claude Code?

Claude Code обращается к Kimi K3 через /v1/messages. Задайте ANTHROPIC_BASE_URL="https://api.wokey.ai", запишите в ANTHROPIC_AUTH_TOKEN свой API-ключ Wokey, укажите ANTHROPIC_MODEL="kimi-k3" и запустите claude. Claude Desktop тоже работает через /v1/messages; пошаговая настройка обоих клиентов есть в руководствах по подключению.

Какое контекстное окно и максимальный объём вывода у Kimi K3?

Контекстное окно Kimi K3 по каталогу — 1,048,576 токенов, максимальный объём вывода — 1,048,576 токенов. Это разные ограничения, и запрос также должен укладываться в ограничения upstream, действующие на момент его обработки.

Как тарифицируются чтение из кэша и запись в кэш для Kimi K3?

Чтение из кэша: у Wokey — $0.09 за 1 млн токенов, официальная справочная цена — $0.3 за 1 млн токенов. Запись в кэш: поставщик модели не публикует отдельную тарифную позицию, поэтому в публичной цене Wokey тоже стоит —.

Чем вызов Kimi K3 через Wokey отличается от OpenRouter?

Wokey предлагает Kimi K3 по $0.9 за входные / $4.5 за выходные токены (за 1 млн) при официальной справочной цене $3 / $15. OpenRouter заявляет, что не делает наценку на инференс и берёт комиссию при покупке кредитов (5,5% при оплате картой). В Wokey — отобранный набор моделей и нет параметров маршрутизации по провайдерам, поэтому, если нужен более широкий каталог, OpenRouter подойдёт лучше. Полное сравнение — на странице об альтернативе OpenRouter.

Чем Kimi K3 и Kimi K2.8 Preview отличаются по цене и контексту?

По публичным ценам Kimi K3 стоит $0.9 / $4.5 (входные/выходные) при контекстном окне 1,048,576 токенов; Kimi K2.8 Preview — $0.3 / $1.2 при контекстном окне 1,048,576 токенов. Это фактическое сравнение цены и ёмкости, а не рейтинг качества; учитывайте также поддерживаемые форматы API и возможности моделей.

Похожие модели и документация

Получить API-ключ · kimi-k3