🌘

Kimi-K3

Moonshot AI 开放权重多模态大模型 · 介绍 / 部署 / 使用

🧠 2.8T 参数 (104B 激活) 🖼️ 原生多模态 📜 1M 上下文 🤗 模型主页 ↗

📖 Kimi-K3 是什么

Kimi-K3 是由 Moonshot AI(月之暗面) 发布的 开放权重多模态大模型,号称"全球首个开放的 3T 级模型", 面向复杂推理与 Agent(智能体)任务。

2.8T总参数量
104B激活参数
896 → 16MoE 专家 (选中/总)
93 层网络深度
1M上下文窗口 (token)
MXFP4权重量化

🏗️ 架构亮点

  • Kimi Delta Attention (KDA)Attention Residuals (AttnRes) 注意力机制
  • Mixture-of-Experts:每次前向从 896 个专家中激活 16 个,兼顾容量与效率
  • MXFP4 权重量化,降低显存占用
  • 支持推理强度设置 low / high / max,多轮对话保留思考历史

✨ 主要能力

能力说明
🧑‍💻 长程编码长时间工程会话、仓库导航与工具编排
📊 知识工作研究、可视化与 Dashboard 生成
🤔 深度推理内置 thinking 模式的复杂问题求解
👁️ 多模态理解原生理解文本 / 图像 / 视频输入
⚠️ Kimi-K3 参数量巨大,无法在免费托管硬件上直接加载推理。 本页「💬 使用方法」中的对话 Demo 通过 OpenAI 兼容接口 从你的浏览器直接调用模型, 需要你自备可访问的端点与 Key。介绍与部署文档无需任何 Key 即可阅读。

🚀 部署方式

Kimi-K3 提供开放权重,可自行本地部署;也可直接调用官方 API

方式一:官方 API(最省事)

platform.kimi.ai 申请 API Key,接口 兼容 OpenAI / Anthropic。拿到 Key 后即可在「使用方法」中在线对话, 或用下方代码调用。

方式二:本地推理引擎(需多卡 GPU)

官方推荐 vLLM / SGLang / TokenSpeed,并在 300K tokens 处触发上下文压缩策略。

vLLM

pip install -U vllm

vllm serve moonshotai/Kimi-K3 \
    --trust-remote-code \
    --tensor-parallel-size 8 \
    --max-model-len 1000000 \
    --served-model-name kimi-k3

启动后即得到 OpenAI 兼容服务,默认 http://localhost:8000/v1

SGLang

pip install "sglang[all]"

python -m sglang.launch_server \
    --model-path moonshotai/Kimi-K3 \
    --trust-remote-code \
    --tp 8 \
    --context-length 1000000

Transformers(研究 / 单机加载)

from transformers import AutoModel

model = AutoModel.from_pretrained(
    "moonshotai/Kimi-K3",
    trust_remote_code=True,
    device_map="auto",
)
💡 2.8T 参数(MXFP4 量化)依然需要多张高显存 GPU。请以模型卡实际硬件要求为准。

方式三:复制本 Space

点击右上角 ⋮ → Duplicate this Space 获得一份可自定义的副本, 随意修改文案与 Demo 默认端点。本 Space 为纯静态页面,复制后即刻可用、零成本托管。

💬 使用方法 · 在线对话 Demo

接口兼容 OpenAI。把 Base URL 指向官方 API 或你本地的 vLLM/SGLang 服务,填入 Key 即可对话。 请求从你的浏览器直接发出,Key 只保存在本地。

⚙️ 高级设置(Base URL / System Prompt / Temperature)
用一句话介绍 Kimi-K3。 写一个 Python 快速排序并解释时间复杂度。 帮我规划一个 3 天的东京旅行行程。
👋 填入端点与 Key,然后发送消息,或点上方示例开始。

💻 代码示例(OpenAI SDK)

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_API_KEY",                 # 本地服务可填任意占位 key
    base_url="https://api.moonshot.ai/v1",  # 本地部署改为 http://localhost:8000/v1
)

resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {"role": "system", "content": "你是 Kimi,由月之暗面提供的智能助手。"},
        {"role": "user", "content": "用一句话介绍你自己。"},
    ],
    temperature=0.6,
)
print(resp.choices[0].message.content)
⚠️ 直接从浏览器调用 api.moonshot.ai 可能被 CORS 拦截。 若报跨域 / 网络错误,请改用支持 CORS 的端点或你本地部署的服务 (http://localhost:8000/v1)。上面的 Python 代码在服务器/本地运行则不受此限制。