Know2研究“被带走”传言前,Kimi如何一路走来?

“被带走”传言前,Kimi如何一路走来?

一个被官方否认的“被带走”传言,和 Kimi 正在进入的第二幕

约 65 分钟阅读

2026 年 9 月中旬,关于月之暗面创始人杨植麟及部分员工“被带走”的传言,先于任何正式文件冲上了舆论场。 社交平台流传的聊天截图和转述,把“被捕”“被调查”等未经证实的说法混在了一起;截至本报告基准日,没有可靠公开证据确认逮捕、调查或公司经营中断。

9 月 12 日,Kimi 官方发布法务声明,称相关信息“纯属虚构、系恶意造谣”,并表示已向公安机关报案。 这份声明能确认的是公司的公开回应和报案表态,不能替我们确认案件最终结果;因此,本文只把这场风波作为舆情与治理风险记录,不把传言写成创始人被捕这一事实。

真正值得投资研究者留意的,是这场传言恰好出现在 Kimi 叙事切换的窗口期:一边是 Kimi K2.8 Preview 全量上线 Kimi Code,继续把编码、思考和 Agent 执行能力推向更长的上下文;另一边是 Kimi Work Remote Control 上线,用户可以通过手机查看进度、发出指令,让任务继续在自己的电脑上运行。与此同时,月之暗面开始推进企业合作伙伴计划,并被报道正与 Microsoft Azure、AWS 和 Google Cloud 洽谈 K3 的海外托管与收入分成。

资本市场也在同一时间把聚光灯打得更亮:Reuters 报道 Moonshot 可能已秘密递交香港 IPO 文件,另有报道提及约 500 亿美元的最新估值;Bloomberg 被转述称其 2026 年 8 月 ARR 已超过 10 亿美元,并以 20 亿美元年化收入作为年末目标。上述内容均来自媒体或知情人士口径,尚不是公司公开财报、交易所文件或审计确认。更棘手的是,Anthropic 同期公开指控部分 Kimi 用户请求可能被转发至 Claude,并涉及模型输出归属与用户数据问题;这仍属于对手方指控,等待原始报告、月之暗面回应和独立技术验证。

于是,Kimi 当前真正面对的已经不只是“模型分数够不够高”这一道题,而是三道必须同时回答的问题:Agent 产品能否成为真实的工作工具,技术热度能否转化为可持续收入,以及模型来源、数据合规和公司治理能否经得起外部审视。 这也是为什么最近的 Kimi 同时出现在产品发布、企业服务、IPO 传闻和舆情风暴四条新闻线上——它正在从一个长文本聊天产品,进入一个需要证明商业闭环的第二幕。

[!quote]- 本节来源与证据边界 官方/公司口径: Kimi 法务声明转述 · K2.8 更新说明 · Remote Control 产品页 · Kimi Work Release Notes 媒体报道: Reuters:港股 IPO · Reuters:云厂商谈判 · Bloomberg:ARR · 企业伙伴计划报道 传言与指控: “被带走”传言报道 · Anthropic 指控转述。传言、报道和对手方指控均不升级为确认事实。

要理解为什么一个长文本聊天产品,会在三年后同时成为 Agent 公司、资本市场标的和舆情风暴中心,就必须把时间拨回 2023 年,从月之暗面刚刚成为一家公司的那一刻开始。


一. 先把主角说清楚:Kimi 不是一个单独的模型

要理解 Kimi,必须同时看四个层次:月之暗面是公司,Kimi 是品牌与产品,K2/K2.5/K3 是模型家族,API、企业版和 Agent 是商业化入口。 这四层在公众叙事中经常被压成一个词,但在研究中不能混写。

层次

本文如何称呼

能确认什么

不能顺手推出什么

境内法律主体

北京月之暗面科技有限公司

营业执照字段、法定代表人、注册资本、成立日期

不等于境外融资主体,也不等于完整控制链

境外被投对象

Moonshot / Moonshot AI Ltd

Alibaba 年报中的被投对象名称和投资描述

不等于已证明与境内主体的法律映射

品牌与产品

Kimi、Kimi Work、Kimi Code、企业版、Claw

官方页面展示的产品入口

不等于各产品已有独立收入或客户规模

模型与方法

Kimi K2、K2.5、K2.6、K2.7、K3;Muon、KDA、AttnRes(分别见 4.3、4.6、5.3 节)

官方论文、README、API 页面所写的模型和方法

不等于所有线上请求都由同一完整配置承载

目前最稳妥的身份标签是:月之暗面是一家以长上下文、稀疏模型、多模态和 Agent 执行为技术主线,向消费工作空间、专业工具、企业服务、API 和开放模型生态延伸的未上市 AI 公司。 “未上市”描述的是研究时点;“基础模型公司”是对公开技术与产品组合的分析归类,不是法律分类。

来源:北京月之暗面科技有限公司营业执照(Kimi 官网静态资源,抓取 2026-09-14);Alibaba《2024 Form 20-F》p.F-35、《2025 Form 20-F》p.F-35、《2026 Form 20-F》p.F-36;Kimi 官网与开放平台页面(抓取 2026-09-14)。 网址: 营业执照 · Alibaba 2024 Form 20-F · Kimi 官网 · Kimi API 模型文档

1.1 这份历史叙事要回答什么

一家公司从“有一个聊天产品”走向“模型—系统—Agent 平台”,中间并不是产品名称不断增加这么简单。真正需要追问的是:

  1. 它先解决了什么问题? 是产品分发、长文本处理,还是训练和推理成本?

  2. 上一代方案留下了什么新问题? 长上下文带来缓存和延迟,模型变宽带来通信,Agent 并行带来总调用量。

  3. 下一代技术为什么在那个时间点出现? 技术节点应该被放回当时的工程矛盾中理解。

  4. 技术有没有走到商业结果? 论文的实验、产品页面的功能、API 的标价和真实收入,必须分层观察。

因此,本文不是简单的“公司大事记”,而是一条带有因果解释的路线:

2023  公司落地与监管备案 ── Kimi Chat 上线(20 万字)建立长文本品牌认知
  → 2024  开放平台公测 / 200 万字上下文 / 探索版 ── 产品出圈,Alibaba 进入正式披露
  → 2025  Moonlight·Kimi-VL 补齐训练与多模态能力
          K2 首次开源(万亿参数)── 能力可被外部独立验证
          K2 Thinking 把「边思考边用工具」做成开源产品
  → 2026  K2.5 / Agent Swarm 让模型从回答者变成任务执行者
          K3(2.8 万亿参数)尝试把宽度、深度、序列、视觉和长程执行放进同一系统
  → 商业化与财务证据等待验证

1.2 读前须知:几个会反复出现的词

后面的章节会出现一批工程术语。读懂它们不需要算法背景,但如果不先交代,后面的解释就会建立在一块空白上。先把地图铺开:大模型大致经过“文本 → 分词(tokenization)→ token → Transformer/attention 计算 → 参数在训练中更新 → 推理时逐 token 生成”的链条;MoE 是在模型内部把部分计算改成“按 token 分流到少数专家”的架构,context window 是一次能放入多少 token 的容量,benchmark 则是外部评测尺子。下面只展开本文会反复用到的几个概念,不把整个大模型教科书搬进来。

结构参考:微信公众号文章;本文只借鉴其机制拆解方式,不将其作为 Kimi 的一手技术证据。

① token(词元)—— 模型读写的计量单位。

模型不直接"看字",而是先把文本切成 token 再处理。中文大致 1 个字对应 1–2 个 token,英文大致 1 个词对应约 1.3 个 token,具体取决于分词器。

这个区别在本报告里很关键:产品宣传常用「字」,而 API 与论文常用 token,两者不是同一个单位。 2023 年 Kimi Chat 宣称的「20 万字」、2024 年的「200 万字」说的是汉字数;而 API 模型名 moonshot-v1-128k 与论文里的「1M context」说的是 token 数。跨口径比较时不能直接当成同一个数来算。

② 参数(parameters)—— 模型内部可调的数字。

可以理解为模型的"神经连接"。参数越多,通常能容纳的知识和规律越多,但训练与运行成本也越高。本报告会出现两种口径:

  • 总参数:模型总共存了多少

  • 激活参数:处理一个 token 时实际动用了多少

对 MoE 模型(见下),这两个数字差别很大。例如 K2 是约 1.04 万亿总参数、约 326 亿激活参数。所以看到「万亿参数」要追问一句:是总参数还是激活参数。 前者决定存储与集群规模,后者更接近单次计算量。

③ MoE(Mixture of Experts,混合专家)—— 把模型做宽,但不让每个 token 都用全部。

模型内部由许多"专家"子网络组成,每处理一个 token,由一个路由(router) 挑出少数几个专家参与计算。好处是总容量可以做得很大、而单 token 计算量仍可控;代价是专家权重必须常驻集群、token 需要在设备之间派发、路由还要处理专家负载均衡。

与之相对,dense(稠密模型)让每个 token 都经过同一套完整参数;MoE 则只为每个 token 激活少数专家,所以总参数可以很大,但单次计算量不必同比增加。

④ 上下文窗口(context window)—— 模型一次能"放在桌面上"的材料量。

窗口越大,一次能读完的报告、代码或对话就越长。但窗口大不等于成本不变:历史越长,缓存、显存和延迟的压力越大。这条矛盾贯穿 2024–2025 年整条技术演进。

⑤ 训练(training)与推理(inference)—— 两张不同的账。

  • 训练:把模型教出来。一次性、极昂贵,通常按 GPU 小时(一块 GPU 跑一小时,是算力成本的基本单位)计

  • 推理:模型对外提供服务。按每次请求、每个 token 计

技术效率的提升往往只影响其中一张账。 本报告会反复强调:训练变便宜,不等于线上回答变便宜。

⑥ benchmark(评测)与数字的来源等级。

benchmark 是标准化考题,便于横向比较能力,但考题分数不等于真实任务成功率。本报告对每个数字标注来源等级:

等级

含义

confirmed

监管、法律或可重复的一手事实

company_stated

公司自己发布的能力、效率、性能数字 —— 公司这么说,尚待外部独立验证

reported

媒体报道,未见公司或监管确认

signal

生态或元数据线索,不足以支撑事实判断

unavailable

检索不到,明确留为缺口

⑦ 四个「扩展轴」—— 把模型做大做强,可以往哪几个方向走。

后文会反复出现「宽度」「深度」「序列」这些说法,它们指的是不同的扩展方向:

  • 宽度:每层内部有多宽(例如 MoE 的专家个数、隐层维度)—— 大致决定一次能动用多少知识

  • 深度:一共有多少层 —— 大致决定推理能串多少步

  • 序列(长度):一次能处理多长的上下文 —— 也就是上下文窗口

  • 模态:能处理哪些类型的输入(文本、图像、视频等)

关键在于:这四个方向各有各的代价,而且代价不一样。 往宽度走会带来专家通信和负载均衡成本;往深度走会遇到信息稀释(见 5.3 节);往序列走会撞上缓存和延迟(见 4.6 节);加模态会推高视觉 token 和 prefill 开销(见 4.4 节)。Kimi 2025–2026 年的论文,本质上是在给这四个方向分别「修路」。这也解释了为什么 K3 的卖点不是「参数最大」,而是「几条路线同时拉高」。

这几个词的关系可以压成一张图:

token(计量单位)
  ├─ 训练:用海量 token 调整参数,按 GPU 小时付费
  └─ 推理:每个 token 触发一次计算,按请求付费
        └─ MoE 让「总参数」很大而「激活参数」较小
              └─ 上下文窗口决定单次能吃进多少 token
                    └─ benchmark 给出能力分数,可信度取决于谁发布

模型四个扩展轴(各有代价)
  宽度(MoE 专家数)· 深度(层数)· 序列(上下文长度)· 模态(文本/图像/…)

二. 2023:Kimi Chat 上线,公司落地并完成备案

2023 年要先说产品,再说主体。 这一年的公开事实里,最有信息量的不是营业执照,而是月之暗面在 10 月推出的第一款面向用户的产品:Kimi Chat 智能助手,卖点是 20 万字输入。https://news.qq.com/rain/a/20231009A09CXZ00

产品首秀几乎与公司成立同步。 官方营业执照显示,北京月之暗面科技有限公司成立于 2023 年 4 月 17 日,法定代表人为杨植麟,注册资本 100 万元,住所位于北京市海淀区知春路 76 号,统一社会信用代码为 91110108MACG2KBH8F。从注册到产品内测,只隔了不到六个月。

2.1 2023 年产品与主体大事记

时间

产品/事件

当时对外说了什么

凭证

2023-04-17

北京月之暗面科技有限公司成立

法定代表人杨植麟,注册资本 100 万元,住所北京海淀知春路 76 号

营业执照(S1,confirmed)

2023-10-09

Kimi Chat 智能助手上线内测

支持 20 万字 输入;由 Moonshot AI 推出;与火山引擎合作做训练与推理加速

月之暗面官方微信公众号原始文章(公司口径,company_stated) · 中国日报 · 新浪财经 · 投资界 · 北京日报(同期交叉验证,reported)

2023-11-03

生成式 AI 服务备案(Moonshot)

备案号 Beijing-MoonShot-20231016,备案单位为北京月之暗面科技有限公司

国家网信办备案公告(S1,confirmed)

这张表要读出的三件事:

  1. 产品先于备案。Kimi Chat 内测在 10 月,备案在 11 月。把备案日期当作产品首发日期,会错记约半年。

  2. 首代卖点是「20 万字」,不是「200 万字」。 200 万字出现在 2024 年 3 月(见下一节)。两者相差半年、相差 10 倍 —— 这是这个产品最重要的代际标记。

  3. 第一天就打「长文本」这张牌,而且从一开始就对外强调与火山引擎的算力合作。说明产品定位不是"再做一个聊天机器人",而是把上下文长度当作差异化卖点。

2.2 关于产品发布来源的说明

2023-10 Kimi Chat 内测已有月之暗面官方微信公众号原始文章作为一手来源。 原始文章提供了产品发布、内测和长文本能力的公司口径;本节同时保留中国日报、新浪财经、投资界和北京日报等同期报道作为交叉验证。换句话说,产品能力和发布信息以官方文章为主,四家同期媒体报道作为旁证。

官方原始文章:月之暗面官方微信公众号。

需要保留的边界是日期精度。 该来源支持公司对产品及其能力的表述,但“2023-10-09”仍是结合同期报道整理出的时间节点;在没有更精确的官方发布时间字段时,不把报道日期机械等同于首发时刻。

2.3 主体边界:营业执照能证明什么、不能证明什么

这个节点能确认的是“公司在境内以什么主体存在”,而不是创始团队从何时开始研发、最初拥有多少人、第一笔融资由谁完成。公司成立日期也不能被当作技术路线的起点;在 AI 公司中,研发、团队组建、境外融资和境内运营可能并不发生在同一实体或同一日期。

2.4 2023 年 11 月:Moonshot 进入生成式 AI 备案记录

中央网信办 2024 年 4 月公布的“生成式人工智能服务已备案信息”附件,记录了北京月之暗面科技有限公司作为备案单位、模型名称为 Moonshot、备案号为 Beijing-MoonShot-20231016、备案时间为 2023 年 11 月 3 日。

备案是监管存在感的第一个公开锚点,但不是商业规模证明。 它说明当时已有以 Moonshot 名义申报的生成式 AI 服务;它不披露用户量、收入、模型大小、训练数据,也不能自动证明当前 Kimi、K2 或 K3 仍由同一备案覆盖。

[!info] 技术补充|“备案”与“模型发布”不是一回事 备案更像是监管系统中的产品登记,而不是论文发表或模型权重发布。它回答的是“谁以什么名称提供了什么类服务”,不回答“模型有多强、用了多少算力、赚了多少钱”。

因此,备案可以证明 Moonshot 在 2023 年已有生成式 AI 服务的监管记录,但不能反推出 Kimi 的技术版本、训练规模或今天的产品路由。把备案日期直接当作模型首发日期,属于把两个时间轴硬焊在一起。

来源:国家互联网信息办公室《关于发布生成式人工智能服务已备案信息的公告》(2024-04-02)及附件,记录 2023-11-03 的 Moonshot 备案;北京月之暗面科技有限公司营业执照(Kimi 官网静态资源,抓取 2026-09-14)。 网址: 国家网信办备案公告 · 营业执照

2.5 早期资本故事:有线索,但还没有交易文件

融资信息比产品资料更碎。这里先不把媒体报道中的融资额和估值拼成一条数字曲线,只记录公开报道提到的时间、轮次和机构;具体来源集中放在第 7.1 节。能写成确认事实的 Alibaba 年报投资披露,另在第 3.3 节单独说明。

因此,本报告的资本叙事只回答“谁在什么时候被报道参与了什么”,不替报道补齐交易金额、持股比例或优先股条款。


三. 2024:长上下文让 Kimi 被看见,Alibaba 进入正式披露

2024 年是 Kimi 从「一个能读长文的助手」变成「一个公开可调用的模型平台」的一年。 产品上有三件事:2 月开放平台公测、3 月上下文从 20 万字跳到 200 万字、10 月发布探索版。资本上有 Alibaba 年报的正式披露。两者都重要,但证据等级不同。

3.1 2024 年产品大事记

时间

产品/事件

当时对外说了什么

凭证

2024-02-06

Moonshot AI 开放平台启动公开测试

对外开放三个基础模型 moonshot-v1-8k / moonshot-v1-32k / moonshot-v1-128k,并公布定价

站长之家(同期媒体,reported)

2024-03-18

Kimi 支持 200 万字无损上下文

上下文由 20 万字 提升至 200 万字,「不到半年提升 10 倍」;官方同时称年内将发布多模态模型

极客公园 · 新浪财经 · 钛媒体(含对月之暗面对话)(同期媒体 ×3,reported)

2024-10-11

Kimi 探索版发布

一次搜索可精读约 500 个页面;搜索量为普通版 10 倍;产品负责人称搜索引擎将成为 AI 更擅长调用的工具

凤凰科技 · 品玩(同期媒体 ×2,reported)

这三件事构成一条清晰的递进:

  1. 2 月开放平台 —— Kimi 从"一个网站"变成"一个可以被人调用的模型服务"。moonshot-v1 是它的第一代 API 模型线,按 8k / 32k / 128k 三档上下文切分。!

  2. 3 月 200 万字 —— 这是 2023 年 10 月「20 万字」之后的第一次量级跃迁,也是 Kimi 真正出圈、A 股"Kimi 概念"大涨的触发点。同一时期官方已预告"年内将发布多模态模型",说明路线图上多模态早于实际落地(Kimi-VL 要到 2025-04 才见论文)。

  3. 10 月探索版 —— 从"能读长文"走到"能自己搜、自己读多个页面"。这是一次明确的产品形态变化:不再只是语言模型问答,而是带检索与推理的 agent 雏形。

为什么 2024 年必须单独看产品 2024 年的产品事实与 2025–2026 年的技术论文之间存在一个容易漏掉的落差:产品侧在 2024 年就已经在讲"长上下文 + 搜索代理",但支撑它的稀疏模型、线性注意力、Agent Swarm 等基础设施要到 2025 年之后才逐篇公开。 也就是说,Kimi 的对外产品叙事领先于公开技术证据约一年。读这份路线图时,不能拿 2025 年的论文去解释 2024 年的产品,也不能因为 2024 年没有论文就认为当时没有技术积累。

可读性边界:本节涉及的 2024 年产品节点目前以同期权威媒体转述为主要可读凭证,状态 reported;2023-10 的官方原始文章已在第 2.2 节单独登记。moonshot-v1 更早的邀请制开放时间未见官方确认,标记 unavailable。

3.2 长上下文:产品差异化的第一条主线

长上下文之所以适合 Kimi 的早期产品叙事,是因为它直接对应了用户能感知的任务:上传长文档、阅读多份资料、处理长代码或连续对话。相比“模型在某个基准上多几分”,长上下文更容易被用户理解为“它能不能把我的材料一次看完”。

但长上下文从一开始就带着工程代价。模型不仅要容纳更多 token,还要在显存、内存带宽、上下文缓存、并发和延迟之间做取舍。后来 Kimi 论文中反复出现的几个词,并不是突然换了赛道,而是在为早期产品差异化补基础设施 —— 先给出各自的定位,第 4 节会逐个展开:

  • MLA:把越来越长的历史压缩成低维表示,替代"原文全存"

  • KDA:用一份固定大小的状态替代完整历史副本

  • 上下文并行:把长序列切开、分摊到多块 GPU 上同时算

  • 长程 Agent:需要连续多步调用工具、跨越很长上下文才能完成的任务

技术补充|长上下文到底解决了什么? 可以把上下文理解成模型一次能放在桌面上阅读的材料数量。桌面变大,模型就能同时看更长的报告、代码库、网页记录和工具返回。

但桌面变大不等于阅读成本消失:需要保存的历史更多,检索和计算更重,显存与延迟也会上升。于是长上下文的核心问题不是“把窗口数字做大”,而是“如何让模型记得足够多,同时不把每次请求变成一次昂贵的全库扫描”。

3.3 Alibaba 的正式投资披露

Alibaba《2024 Form 20-F》披露,截至 2024 年 3 月 31 日的财年,公司累计以约 8 亿美元取得 Moonshot 约 36% 的 equity interest,投资工具为优先股。2025 和 2026 年 Form 20-F 继续重复披露这一事项,并说明该优先股投资采用 measurement alternative 核算。

这份披露能确认 Alibaba 对名为 Moonshot 的对象存在重大优先股投资,但不能自动确认境内公司持股比例、控制权或完整经济权益。 年报相关段落没有同时给出 Moonshot AI Ltd 的注册地、完整 cap table、投票权、清算优先、转换条款、后续稀释,或者它与北京月之暗面科技有限公司的控制链。

能够写成确认事实

不能越过的边界

Alibaba 年报披露约 8 亿美元投资

不能写成“Alibaba 持有境内公司 36%”

年报写约 36% equity interest

不能改写成已确认的 36% 经济权益或投票权

投资工具为优先股

不能据此推导清算优先、转换和稀释条款

2025/2026 年报继续披露

不能据此确认当前仍保持同一比例

这里的谨慎不是文字游戏,而是未上市公司研究的基本功:投资方年报确认的是被投对象、金额和披露口径;它不是替代 cap table 的完整法律文件。

来源:Alibaba《2024 Form 20-F》p.F-35、《2025 Form 20-F》p.F-35、《2026 Form 20-F》p.F-36;境内主体营业执照(Kimi 官网静态资源,抓取 2026-09-14)。 网址: Alibaba 2024 Form 20-F · Alibaba 2025 Form 20-F · Alibaba 2026 Form 20-F · 营业执照

3.4 2024 年之后留下的主体问题

到研究基准日,官网 About/企业页页脚仍显示“北京月之暗面科技有限公司”,而 2026 年 8 月 31 日生效的用户协议与隐私政策使用“北京月之暗面科技股份有限公司及其关联公司”。这可能是股改后的页面未同步、不同业务采用不同运营主体,或者法律文本存在错误;当前没有工商变更档案把三种解释裁决出来。

因此,Kimi 的历史线在 2024 年已经出现两条需要分开追踪的链:一条是产品和技术公开演进,另一条是法律主体与境外资本结构映射。 前一条资料越来越多,后一条仍然有关键断点。

来源:Kimi About/企业版页面(抓取 2026-09-14);Kimi 用户协议、隐私政策(版本生效 2026-08-31,更新 2026-08-24);北京月之暗面科技有限公司营业执照。 网址: Kimi About · Kimi 企业版 · 用户协议 · 隐私政策 · 营业执照


四. 2025:从“长文本产品”转向“模型系统”

2025 年是 Kimi 技术路线真正展开的一年:公司公开材料不再只回答“模型能读多长”,而开始回答“模型如何训练、如何扩大总容量、如何处理视觉输入,以及如何把长上下文成本压下来”。 这一年可以看成从产品差异化走向系统工程的转折。

产品侧同样有两件大事:7 月 K2 首次开源万亿参数模型,11 月 K2 Thinking 把「边思考边用工具」做成开源版本。

4.1 2025 年产品大事记

时间

产品/事件

当时对外说了什么

凭证

2025-07-11

Kimi K2 发布并开源

月之暗面旗下首个万亿参数开源模型;主打代码与 Agentic 任务

IT之家 · 界面新闻(同期媒体 ×2,reported)

2025-11-07

Kimi K2 Thinking 开源

原生掌握「边思考、边用工具」;被媒体称为当时最强开源思考模型

DoNews · 每日经济新闻(同期媒体 ×2,reported)

这两次发布的含义不同:

  1. K2(7 月)是「把模型做宽」的商业化节点。 1 万亿总参数、32B 激活的 MoE 是首次对外可下载的旗舰模型 —— 从这一年起,Kimi 的能力开始可以被外部独立验证,产品竞争也从"比谁的窗口大"转向"比谁的单位成本低"。技术侧的 MuonClip、MLA 细节见 [[#4.5 2025 年 7 月:Kimi K2,把模型做宽但不让每个 token 都付全价|4.5 节]]。

  2. K2 Thinking(11 月)是「把推理变成可用产品」的节点。 它解决的问题不是问答质量,而是让模型在思考过程中直接调用工具,这是 2026 年 Agent Swarm 的前置条件。从产品角度看,这是 Kimi 从"回答者"向"执行者"转型的公开起点。

为什么 2025 年要同时看「论文」和「产品发布」 本节后半部分逐篇讲 2025 年的技术论文(Moonlight、Kimi-VL、K2、Kimi Linear),那是技术证据。但技术论文的公开日期与产品发布日不是同一天,有时相差数月。上表登记的是产品发布事件,两者需分开引用:论文回答"它做了什么",发布回答"什么时候用户能用上"。

特别提示:K2 的论文(arXiv:2507.20534)与产品开源(2025-07-11)时间接近,但 Kimi Linear(2025-10)的论文至今没有对应的公开产品发布事件。 不要把论文当作发布。

4.2 2025 年 1 月:K1.5 只留下生态信号

本轮在 Moonshot AI 官方 GitHub 组织中观察到 Kimi-k1.5 仓库快照,仓库元数据时间为 2025 年 1 月 19 日。这个节点可以作为公开生态时间线中的信号,但不能代替模型正式发布公告,也不能据此推导 K1.5 的完整发布时间、训练规模或商业化关系。

这看似是一个小小的证据等级问题,实际上决定了历史叙事是否可靠。 GitHub 仓库创建时间可能早于正式发布,也可能只是内部代码公开;把它当作正式发布日,会让整条模型时间线从第一步就产生伪精确。

来源:Moonshot AI GitHub 组织仓库 API 快照(抓取 2026-09-14);状态为 signal,不作为 K1.5 正式发布日。 网址: Moonshot AI GitHub 仓库列表 · Moonshot AI GitHub 组织

4.3 2025 年 2 月:Moonlight / Muon,先从“怎么训练”下手

2025 年 2 月公开的 Muon is Scalable for LLM Training 把焦点放在训练优化器上。

这里要先把三个词交代清楚(训练侧的通用概念,后文还会用到):

损失函数(loss) 衡量模型当前答得有多差,训练的目标就是让这个数字不断下降。优化器(optimizer) 决定每一步参数往哪个方向改、改多大。把训练想成在雾中的山地下坡:损失函数是当前海拔,优化器是迈步规则。

AdamW 是过去几年最主流的优化器,它给每个参数单独调节步长,像给每颗螺丝单独拧力度。Muon 是这篇论文的主角,做法不同:它把部分隐藏层矩阵当作整体来处理,先整理更新方向,再决定怎么移动,而不是逐参数独立调节。

论文里的 Moonlight 是一个 MoE 模型,记作 3B/16B —— 即激活参数约 30 亿、总参数约 160 亿(这个记法容易读反,前者是"每次实际用多少",后者是"一共存了多少")。训练使用了 5.7T tokens(5.7 万亿个词元)。论文在 scaling-law 实验中报告 Muon 相对 AdamW 取得约 2 倍计算效率 —— scaling law 指的是"用不同模型规模和不同训练量做对照,观察效率随规模如何变化"的方法。这个 2 倍是受控实验里的结果,不是线上服务的成本降幅。

这一步的意义在于:它把公司的技术问题从"模型输出更好"往前推到了"同样的训练预算能不能学得更多"。如果模型规模持续扩大,优化器就不再只是研究人员的后台工具,而会直接影响公司能否承受更多数据、更多实验和更大模型的试错成本。

技术补充|Moonlight 在 Muon 之上补的三件事 Muon 能提效率,但推到大规模训练还有三个具体问题,Moonlight 各给了做法:

weight decay(权重衰减) —— 一种防止模型"学过头"的正则项:每一步都让参数朝零的方向轻轻收一点,避免把训练数据里的噪声也一起背下来。名字里的 decay(衰减)就是这个意思。

update scale(更新尺度) —— 控制每步实际迈多大。步长太大容易在最优点附近来回震荡,太小则学得慢;Moonlight 按参数形状来校准这个尺度,而不是所有层共用一个值。

分布式训练实现 —— 大模型一块 GPU 装不下,参数要切分到成百上千块卡上协同计算,需要专门的通信与同步方案;否则再好的优化器也跑不起来。

后来 K2 又遇到一个新问题:Muon 可能让 attention logits(注意力打分 —— 模型在决定"该关注谁"时给出的原始分数,越大表示越倾向关注)数值过大而爆炸,训练随之失稳。K2 用 QK-Clip 给这些分数设了一道"压力阀":超过阈值就压回去。官方称 K2 用这套方法训练了 15.5T tokens 而未出现 loss spike(损失突然跳高,通常意味着训练崩了)。

来源:Moonlight《Muon is Scalable for LLM Training》arXiv:2502.16982,摘要、§1、§2.2,pp.1–4、8–9;Moonshot AI 官方 Moonlight 仓库;效率数字为 company_stated。 网址: Moonlight 论文 · Moonlight 官方仓库

4.4 2025 年 4 月:Kimi-VL,图片不再只是“先转成文字再处理”

2025 年 4 月公开的 Kimi-VL 技术报告,把视觉、MoE 和长上下文放进一个公开模型系统。报告描述了约 160 亿总参数、约 28 亿激活参数的 MoE 视觉语言模型配置、128K 上下文,以及名为 MoonViT 的原生分辨率视觉编码器。

这里两个词值得先说明:

视觉编码器(vision encoder) 是把图像转成模型能处理的数字表示的组件 —— 语言模型本身只认 token,读不懂像素,中间需要一道「翻译」。

原生分辨率(native resolution) 指尽量按图片本来的尺寸和比例处理,而不是先统一缩放成某个固定大小。

Kimi-VL 的转折在于,它把长上下文从纯文本问题扩展成了「长文档、网页、截图、视频和视觉细节如何共同进入模型」的问题。 对 OCR(把图片里的文字识别出来)、表格、图表和屏幕操作而言,图片被压缩或切碎之后,丢掉的细节可能正是答案本身。

技术补充|MoonViT 为什么不直接把图片压小? 想象一张工程图:如果先把它压成缩略图再交给模型,整体布局还在,但尺寸、标注和小字可能消失;如果切成很多小图再拼接,细节保住了,预处理和 token 数又会上升。

MoonViT 的路线是尽量保留输入图像的原生空间信息,再用 projector(投影层) 这一小段把视觉特征「翻译」成语言模型能直接消费的表示 —— 相当于把图像的内部编码译成模型读得懂的另一种语言。语言模型负责理解和推理,视觉编码器负责尽量看清楚。

代价也很直白:分辨率越高,需要的视觉 token、prefill 计算(模型在开始生成回答之前,先把整段输入读完并建立缓存的阶段;输入越长,这一步越贵)和显存占用都越多。128K 是上下文容量,不代表任意长视频都能低成本、无损处理;论文里的 benchmark 分数也不等于线上产品的真实任务成功率。

来源:Kimi-VL Technical Report,arXiv:2504.07491,摘要、§1、§2.1、§2.2、§5,pp.1–5、18;Moonshot AI 官方 Kimi-VL 仓库;架构与 benchmark 数字为 company_stated。 网址: Kimi-VL 论文 · Kimi-VL 官方仓库

4.5 2025 年 7 月:Kimi K2,把模型做宽但不让每个 token 都付全价

2025 年 7 月公开的 Kimi K2,代表路线从视觉模型进一步走向大规模开放模型。官方 README 和技术报告列示约 1.04T 总参数、约 32.6B 激活参数、384 个专家、每个 token 选择 8 个专家、128K 上下文,并采用 MLA。

K2 的核心不是一个孤立的“1T 参数”标题,而是总容量、单 token 计算、训练稳定性和长上下文缓存的组合。 这也是 Kimi 后来不断重复的系统式做法:每个技术模块解决一个瓶颈,但最终价值来自模块能不能一起运行。

技术补充|MoE 为什么可以把总参数做大? MoE 可以理解为一所拥有很多专科的医院。分诊台先看病人的问题,再从大量专家中挑少数相关科室;每个 token 不需要让所有专家同时工作。

好处是总知识容量和单 token 计算可以部分解耦。代价是专家权重仍要驻留在集群里,token 需要在设备之间派发,router 还要处理专家负载均衡。因此“32.6B 激活”不等于“只需要一台 32.6B 稠密模型的机器”,更不等于可以直接算出线上 GPU 成本。

K2 同时引入 MuonClip/QK-Clip 叙事 —— MuonClip 可以理解为 Muon 优化器加上 QK-Clip 这道稳定器的组合(QK-Clip 的作用见 4.3 节):Muon 的训练效率必须与大规模训练的稳定性一起处理;报告称 K2 使用 MuonClip 训练了 15.5T tokens 而没有出现 loss spike。这个数字和稳定性结论属于公司/作者技术报告自报,不能改写成已经审计的训练账单或所有产品的线上配置。

来源:Kimi K2《Open Agentic Intelligence》arXiv:2507.20534,摘要、§1、§2.1、§4、长上下文与训练章节,pp.1、3–4、6–9;Kimi K2 官方 README;参数和训练效率为 company_stated。 网址: Kimi K2 论文 · Kimi K2 官方仓库 · Kimi K2 技术页面

4.6 2025 年 10 月:Kimi Linear / KDA,给百万上下文准备“混合动力”

2025 年 10 月公开的 Kimi Linear,把此前的长上下文问题推进到更具体的架构层。报告提出 Kimi Delta Attention(KDA)与 MLA 的混合注意力,并在 1M context 实验中报告 KV cache 最多减少 75%、解码吞吐最多提升 6 倍;架构采用约 3:1 的 KDA 与 MLA 层级折中。

这一节有三个词决定整篇论文的意义:

注意力(attention) 是模型判断「当前这个词该参考前文哪些位置」的机制。KV cache(键值缓存) 是它的副产品:生成过程中,前面每个 token 的中间结果都要存下来供后续复用,历史越长这份缓存越大 —— 长上下文的主要成本就压在这里。解码吞吐(decode throughput) 指每秒能生成多少 token,直接决定用户体验和单位服务成本。

Kimi Linear 的真正问题不是“有没有更长的窗口”,而是“在窗口变长后,模型还能否以可接受的显存、带宽和延迟工作”。 它把长上下文从产品卖点继续推进成了服务成本问题。

技术补充|MLA 与 KDA 如何处理长上下文? 标准注意力在生成时需要保存越来越长的历史 key/value(即上面说的 KV cache),像把每一页原始档案都堆在桌面上。MLA 把历史压缩成较低维的 latent 表示(latent 意为「隐」的:不直接存原始向量,而存一份维度更低的浓缩编码),像给档案制作索引卡。

KDA 则更像一本会不断改写的摘要本:它只维护一份固定大小的状态,不保存每个历史 token 的完整副本。channel-wise forget gate(逐通道遗忘门) 让信息的不同维度各有「保鲜期」—— 该忘的多忘一点,该留的少忘一点;delta update(增量更新) 允许新读到的 token 去修正旧记忆里的对应内容,而不是只能往后追加。周期性的 MLA 层再打开更完整的全局档案,处理需要精确定位远处内容的任务。

这就是为什么它是混合架构而不是纯线性注意力。摘要本便宜,但可能漏掉逐字细节;原始档案精确,但昂贵。论文报告的 75% 和 6 倍是受控实验中的上限数字,不能直接乘到公司整体吞吐或利润率上。

来源:Kimi Linear《An Expressive, Efficient Attention Architecture》arXiv:2510.26692,摘要、§1、§3、§4、§5–§6、§18,pp.1–2、4–9、18;Kimi Linear 官方仓库;效率数字为 company_stated。 网址: Kimi Linear 论文 · Kimi Linear 官方仓库 · Gated DeltaNet 背景论文

4.7 2025 年这一年的意义:从功能路线到系统路线

把 2025 年几个节点放在一起,顺序就清楚了:

Muon / Moonlight:怎样更高效地训练
  → Kimi-VL / MoonViT:怎样保留视觉细节
  → Kimi K2 / MoE:怎样把总容量做宽而控制单 token 计算
  → MLA / Kimi Linear:怎样让更长的历史不把缓存和延迟拖垮

Kimi 的研发重点开始从“做出一个更会回答的模型”转向“把训练、模型宽度、视觉输入和长序列服务成本一起优化”。 这为 2026 年 Agent 化埋下了伏笔:Agent 不是只生成一段文本,它会持续读取、调用工具、写入状态,因而会把上下文和推理成本问题放大。

来源:Moonlight、Kimi-VL、Kimi K2、Kimi Linear 技术报告与官方仓库;路线归纳为分析层判断,相关证据见 [[wiki/实习/02_Know2/Kimi研究/01_原始证据/技术论文摘录_Kimi技术路线_260915]]。 网址: Moonlight · Kimi-VL · Kimi K2 · Kimi Linear


五. 2026:从模型能力走向 Agent 系统

2026 年的公开节点显示,Kimi 的核心问题发生了变化:不再只是让一个模型读得更长,而是让模型把复杂任务拆开、并行执行、持续运行,并在更深、更宽、更长的模型中维持信息流。 K2.5、Agent Swarm、PARL、Attention Residuals 和 K3 是这条新阶段的连续节点。

产品侧的关键发布是 7 月的 K3 —— 2.8 万亿参数,把参数规模推到开源模型从没有过的高度。

5.1 2026 年产品大事记

时间

产品/事件

当时对外说了什么

凭证

2026-07-17

Kimi K3 发布并开源

2.8 万亿参数、原生支持视觉理解、100 万词元上下文窗口;被称为全球首个 3 万亿级别开源模型

北京日报海淀 · 搜狐科技 · 新京报(同期媒体 ×3,reported)

2026-08-31

kimi-k2.5 与 moonshot-v1 系列下线

API 调用返回 404;建议迁移至 kimi-k3

Kimi API 模型文档(官方页面,confirmed)

K3 这次发布要读出两点:

  1. 参数规模是这条路线的一个结论,不是起点。 从 2025-07 的 K2(1T)到 2026-07 的 K3(2.8T),一年内总参数扩大约 2.8 倍。支撑它的不是简单的"堆参数",而是前面几节讲过的 Muon、MLA、KDA、AttnRes 等一系列让训练和推理成本可控的手段。没有这些,2.8T 只会在训练阶段就失败。![[Pasted image 20260915201106.png]]

  2. moonshot-v1 在 2026-08-31 下线,标志第一代 API 模型线正式退场。 从 2024-02 开放平台公测到下线,这条产品线存活约两年半。用当前 API 文档回看历史时要注意:你现在查到的"可用模型"清单已经不含任何 2023–2024 年的初代模型。

2026 年的产品发布证据缺口 K2.5(2026-02)没有取得同期产品发布报道。 现有的 K2.5 证据是技术论文(arXiv:2602.02276)与 API 文档,两者都不能替代"产品何时对外发布"这一事实。本表因此不列出 K2.5 的发布日,也不以论文日期替代 —— 这是本报告在 2026 年段唯一的产品时间线缺口。

5.2 2026 年 2 月:K2.5 与 Agent Swarm,把“一个模型”拆成“一个团队”

2026 年 2 月公开的 Kimi K2.5 技术报告把多模态模型与 Agent 执行结合起来,提出 Agent Swarm(智能体集群):由 orchestrator(调度者) 判断复杂任务如何拆分,动态创建不同职责的子 Agent,让它们并行执行,最后汇总结果。

报告还提出 PARL(Parallel Agent Reinforcement Learning,并行智能体强化学习),把任务分解与协作纳入训练目标。强化学习指不直接教模型「标准答案」,而是让它尝试、按结果好坏给奖励或惩罚,逐步学会什么做法更有效 —— 对「该怎么拆分任务、该怎么协作」这类没有唯一正确答案的能力,这比模仿示例更合适。

这一步是产品和技术之间的一次明显换挡:模型不再只是回答者,而开始被描述成一个能够组织工作流的调度者。 研究、代码、视觉、搜索、验证等任务可以被分开;主 Agent 负责分派和验收,子 Agent 负责局部执行。

技术补充|Agent Swarm 为什么可能降低墙钟时间? 单 Agent 做复杂任务像一个项目经理亲自排队完成研究、代码和审校:研究结束后才能写代码,代码结束后才能验证,所有中间过程都塞回同一个上下文。

Agent Swarm 更像项目经理把三项工作分给三个小组并行推进,最后统一汇总和验收。若任务确实可拆,完成时间可能从各分支时间之和变成最长分支的时间。

但并行不是免费午餐:子 Agent 数量增加,会带来更多 token、工具调用费、失败重试和结果合并成本。任务不可分解、分支过短或验证很重时,系统可能只是更快地产生更多错误。K2.5 报告称最高约 4.5 倍延迟改善,仍属于 company_stated,不是生产平均值。

来源:Kimi K2.5《Visual Agentic Intelligence》arXiv:2602.02276,摘要、§1、§3–§5、实验章节,pp.1–2、5–8、14–15;Agent Swarm 与 PARL 的性能数字为 company_stated。 网址: Kimi K2.5 论文

5.3 2026 年 3 月:Attention Residuals,模型变深后不能只做“逐层累加”

先把模型想成一条很长的流水线。每一层都会在前一层的“草稿”上再改一点:有的层补事实,有的层改语气,有的层处理逻辑。层数越多,模型能做的加工越细,但也带来一个问题:这么多次修改,最后应该保留哪些,不能只靠一套固定的加法规则。

传统的 残差连接(residual) 可以理解成“保留旧稿,再叠加本层的新修改”。它给信息留了一条近路,不必每次都重新穿过整条流水线。PreNorm 是在每层开始前,先把输入的数值尺度调到比较稳定;梯度则是训练时从结果反向传回来的纠偏信号,告诉模型各个参数应该往哪个方向调整。模型变深以后,如果每层都用固定方式把结果加回去,早期信息可能被后面的大量修改冲淡,训练过程的数值也更难控制。

Attention Residuals(AttnRes) 的思路,是让当前层先回头看一眼此前各层的结果,再根据当前任务决定哪些更值得保留,而不是把所有历史表示一股脑相加。它会给不同历史层打分,再用 softmax 把分数换成总和为 1 的权重,最后按权重混合:相关的层多取一点,不相关的层少取一点。

Block AttnRes 则是一个工程上的折中:不逐层查看全部历史,而是先把若干层分成一组,再在组与组之间选择。这样会损失一部分精细选择能力,但可以减少需要保存、搬运和计算的历史信息,适合更深的模型。

[!info] 技术补充|AttnRes 解决的是“深度的信息稀释” 普通 residual 像每次都把上一版文件和本层修改直接合并。层数少时问题不大;层数多了,早期内容可能被一轮轮修改盖住。

AttnRes 像让当前项目按需翻阅历史章节:它根据当前内容决定哪些层的表示更重要。Block AttnRes 则先按章节做目录,不逐层检索,以换取更可控的内存和通信。

代价是系统需要保存、访问和聚合历史表示;因此它可能改善深度扩展,却不等于线上速度必然提升,更不等于事实性自动变好。

来源:Attention Residuals arXiv:2603.15031,摘要、§1、Block AttnRes 及实验章节,pp.1–2、8–11;方法与实验为 company_stated。 网址: Attention Residuals 论文

5.4 2026 年 7 月:K3,尝试把所有扩展方向放到同一台机器上

2026 年 7 月公开的 Kimi K3,是目前公开技术路线的集中表达。官方论文和 README 描述 K3 为原生多模态 Agent 模型,约 2.8T 总参数、104B 激活参数、896 个 routed experts、每个 token 选择 16 个专家,采用 KDA 与 Gated MLA,结合 AttnRes、Stable LatentMoE、原生视觉和 1M token 上下文。材料还描述了百万 token Agentic RL、持久 rollout 和 sandbox states 等长程执行训练方向。

K3 的意义不在于把一张参数表做得更大,而在于它把序列、深度、宽度、模态和 Agent 执行五条路线同时拉高。 KDA/Gated MLA 面向序列长度,AttnRes 面向深度,Stable LatentMoE 面向模型宽度,native vision 面向视觉输入,Agentic RL 面向长程任务执行。

技术补充|1M 上下文不等于模型拥有 1M 的“同质记忆” “1M context”首先表示系统允许把最多约一百万 token 放入一次任务的上下文范围。它不保证模型能对每一个位置做到同样准确的检索,也不保证高分辨率图片、工具返回和长链路中间状态都能低成本处理。

真正要测的是:在不同位置的事实召回率、跨文档推理、逐字复制、工具调用后的记忆、p50/p95 延迟、显存占用和每任务成本。窗口上限是容量指标,长任务完成质量和经济性才是商业指标。

K3 材料称相对 K2 整体 scaling efficiency(扩展效率) 改善约 2.5 倍 —— 即投入同样的算力能换来多少能力提升。这个数字是公司技术报告口径,无法拆分究竟来自 KDA、AttnRes、MoE 稀疏度(每个 token 动用多少比例的专家)、数据规模、训练 recipe(数据配比、训练步数、超参数等一整套训练配方)还是系统优化,更不能直接外推为公司毛利率改善。

来源:Kimi K3《Open Frontier Intelligence》arXiv:2607.24653,摘要、架构、训练与 Agentic RL 章节,pp.1–3、6–12、21–25、32–35;Kimi K3 官方 README 与 LICENSE;架构字段为官方材料事实,效率数字为 company_stated。 网址: Kimi K3 论文 · Kimi K3 官方仓库 · Kimi K3 License

5.5 2026 年 9 月:技术路线开始变成版本生命周期

截至 2026 年 9 月 14 日的 API 模型页面显示,当前可用模型包括 kimi-k3、kimi-k2.7-code、kimi-k2.7-code-highspeed 和 kimi-k2.6;页面同时列示 K2.5、moonshot-v1、较早 K2 系列及 kimi-latest 的下线日期。

这意味着 Kimi 的研发成果已经进入平台运营阶段:模型不只是论文和权重,还要有版本迁移、价格、限速、兼容性和生命周期管理。 对企业客户而言,模型什么时候下线、接口是否兼容、历史调用能否复现,和 benchmark 分数一样重要。

API 页面支持 OpenAI Chat Completions、OpenAI Responses 和 Anthropic Messages 兼容接口;K3 标价为缓存命中输入 ¥2、未命中输入 ¥20、输出 ¥100/百万 token;K2.7 Code、Highspeed 与 K2.6 也有公开价格。 ![[Pasted image 20260915202521.png]] 这里的计费结构本身就是技术路线的商业投影,值得逐个说明:

  • 缓存命中 / 未命中 —— 如果这次请求的开头与之前某次相同(比如反复追问同一份长文档),前文已经算过并存在缓存里,可以直接复用,所以便宜十倍;没命中就要从头算一遍,所以贵

  • Batch API —— 不要求实时返回、可以排队批量处理的请求,按标准价格的 60% 计费

  • 工具调用 —— 模型调用联网搜索等外部能力时按次另收 ¥0.03

  • Tier / RPM / TPM / TPD —— 账户按充值金额分级(Tier),不同级别对应不同的**每分钟请求数(RPM)、每分钟 token 数(TPM)、每日 token 数(TPD)**上限,也就是并发能力的天花板

来源:Kimi API 模型、概述、定价、Batch、工具和限速文档(页面快照 2026-09-14,部分页面更新至 2026-09-11);模型版本下线日期和价格为官方页面事实,不等于实际成交价或收入。 网址: API 模型 · API 概述 · 模型定价 · Batch 定价 · 工具定价 · 限速规则


6. 产品是怎样随技术路线一起变化的

Kimi 的产品演进可以理解为“从一个入口,变成一组围绕知识工作的执行工具”,但产品矩阵的扩张仍不能直接等同于商业规模的扩张。 当前官方页面展示的不是单一聊天框,而是多个任务入口:

Kimi 对话
  → 深度研究 / PPT / 网站 / 表格 / 文档
  → Kimi Work:本地文件、定时任务、后台运行
  → Kimi Code:Terminal 与 IDE 编程 Agent
  → 浏览器扩展 / Kimi Claw:浏览器和 7×24 Agent
  → 企业版:空间、成员、数据隔离
  → API:按 token、Batch、工具调用、Tier 限速
  → 开放模型:权重、代码、论文和开发者生态

6.0 产品线的历史演进(与第 2–5 节的按年份视角互补)

前面几节按年份讲"这一年发生了什么",这里按产品线讲"每条线是怎么长出来的"。同一事实不重复展开,只做归位。

产品线

起点

关键节点

现在的形态

C 端对话入口

2023-10 Kimi Chat(20 万字)

2024-03 提升至 200 万字 → 2024-10 探索版(带检索)

Kimi 对话 + 深度研究 / PPT / 网站 / 表格 / 文档

开发者 API

2024-02 开放平台公测(moonshot-v1-8k/32k/128k)

2025-01 kimi-latest → 后续 K2 / K2.5 / K2.6 / K2.7 系列

按 token 计价的模型服务;moonshot-v1 已于 2026-08-31 下线

开放模型(开源)

2025-07-11 K2 发布并开源(万亿参数)

2025-11 K2 Thinking → 2026-07 K3(2.8 万亿参数)

GitHub / Hugging Face 权重、代码、许可与论文

推理与工具调用

2025-11 K2 Thinking(边思考边用工具)

2026-02 K2.5 / Agent Swarm(并行子任务)

从"回答者"走向"任务执行者"

工作流 Agent

2024-10 探索版(检索雏形)

之后扩展至 Work / Code / 浏览器扩展

Kimi Work(本地文件、定时任务)、Kimi Code(Terminal / IDE)

企业服务

—

当前页面形态

独立企业空间、成员与数据隔离;上线时间未取得可核来源

这张表要带走的一个结构性认识:Kimi 的产品线不是同时起步的,而是"一条先跑、其余跟着长"。 C 端对话入口(2023)先跑,用它换品牌认知;API(2024)跟上,把能力变成可计价的服务;开源模型(2025)再跟上,把技术可信度交出去让外部验证;Agent 与工作流(2025 下半年起)最后成形,把模型从回答问题推进到执行任务。

这张表有两处不能填

  1. 企业版的上线时间:只能看到当前页面形态,没有可核的发布记录。

  2. kimi-latest 等中间版本的准确发布时间:API 文档只给出下线日期,未见上线公告。不要用下线日期倒推上线日期。

来源:当前产品形态见 Kimi 官网与企业版页面(抓取 2026-09-14);版本下线见 Kimi API 模型文档。

6.1 Chat:从“回答问题”到“处理材料”

早期长上下文定位最容易被用户感知,因为它把模型的价值从一句问答延伸到整份材料:读报告、总结长文、整理代码、比较多个文件。产品价值不再只是模型的知识量,还包括能否保持上下文、引用材料和持续完成任务。

但这个入口的公开资料仍然缺少 MAU / DAU(月活 / 日活跃用户数)、付费率、留存、会员价格历史和 ARPU(每用户平均收入)。产品页面证明「有什么功能」,不能证明「有多少人持续为它付费」。

6.2 Work 与 Code:把模型放进用户的工作环境

Kimi Work 公开定位为连接本地文件、支持定时任务和后台运行的桌面 Agent;Kimi Code 面向 Terminal 与 IDE,承担编程任务。它们代表一个重要变化:产品竞争开始从“模型回答得好不好”转为“模型是否能进入用户已有的工作流”。

一旦进入工作流,衡量标准就会变复杂:任务成功率、人工接管率、运行时间、失败重试、权限边界、数据隔离和版本稳定性,都会比一次性的对话满意度更重要。当前公开资料尚未提供这些指标。

6.3 企业版:更高客单价,也更高合规要求

企业版页面展示独立企业空间、成员管理、企业与个人空间隔离,并称企业数据不用于模型训练。个人隐私政策则写明,输入输出内容可能被用于优化模型,并提供停止用于训练的客服请求路径。

这两类表述可能因产品和用户类型不同而并存,但不能用企业页面的承诺替代合同、DPA、技术隔离架构或审计报告。 企业商业化的关键不只是卖出坐席,还包括客户能否把内部数据、权限、审计和责任边界交给平台。

6.4 API 与开放模型:两条相反但可以协同的路

API 是最容易建立价格函数的入口。公开文档提供模型价格、缓存命中/未命中、Batch、工具调用和账户限速,OpenAI/Anthropic 兼容接口也降低了迁移成本。开放模型则通过权重、代码、论文和 GitHub/Hugging Face 扩大开发者触达。

API 让收入更容易被计算,开放模型让生态更容易扩散;但两者都需要真实使用数据才能变成商业结论。 API 标价不是收入,下载量不是生产部署,GitHub Stars 也不是客户数。开放权重还可能降低平台锁定,除非它最终导流到托管、API 或企业服务。

来源:Kimi 官网 https://www.kimi.com/;Kimi 企业版 https://www.kimi.com/business;Kimi API 概述、模型、定价与限速文档;Kimi K2/K3 官方 GitHub 仓库;Hugging Face 与 GitHub 生态快照(抓取 2026-09-14)。 网址: Kimi 官网 · 企业版 · API 概述 · API 模型 · Kimi K2 · Kimi K3 · Hugging Face Moonshot AI


7. 资本与商业化:技术向前跑,财务证据没有同步公开

Moonshot 的资本叙事在 2025–2026 年明显加速,但正式财务证据没有以同样速度出现。 这造成了一个研究上的错觉:报道中的估值和 ARR 数字越来越大,读者容易误以为收入、现金流和 cap table 也已经被公开验证。

7.1 资本事件与公开来源

下面这张表集中列出网络公开资料中的融资与上市线索。表内不列未经正式文件确认的融资额和估值;来源均保留为完整网址,便于逐条回看。

时间

公开事件

公开披露的机构或相关方

证据状态

信息来源网址

2023 年 6 月前后

早期融资 / 天使轮报道

红杉中国、真格基金、今日资本等

reported

https://news.qq.com/rain/a/20240222A098X600

2023 年 7 月

A1 轮报道

美团龙珠领投

reported

https://36kr.com/p/2702952035612807

2023 年 10 月

Kimi Chat 发布同期融资报道

红杉资本、今日资本、砺思资本等

reported

https://finance.sina.com.cn/tech/roll/2023-10-10/doc-imzqriae8057388.shtml https://www.thepaper.cn/newsDetail_forward_24878773

2023 年 11 月

阿里、蚂蚁早期投资报道

Alibaba、蚂蚁

reported

https://mp.weixin.qq.com/s/MafY4h7Tju-pmxf30tjjKA

2024 年 2 月

A+ 轮报道

公开报道提及 A+ 轮,机构口径未完全统一

reported

https://news.qq.com/rain/a/20240222A098X600 https://mp.weixin.qq.com/s/MafY4h7Tju-pmxf30tjjKA

截至 2024-03-31

Alibaba 年报披露对 Moonshot 的投资

Alibaba

confirmed

https://www.sec.gov/Archives/edgar/data/1577552/000095017024063767/baba-20240331.htm https://www.sec.gov/Archives/edgar/data/1577552/000095017025090161/baba-20250331.htm https://www.sec.gov/Archives/edgar/data/1577552/000119312526231755/baba-20260331.htm

2025 年 12 月

C 轮融资报道

投资方完整名单未见公开确认

reported

https://news.qq.com/rain/a/20260729A0AWPL00 https://finance.sina.com.cn/stock/t/2026-05-07/doc-inhxanxc8239393.shtml

2026 年 5 月

新一轮融资报道

美团龙珠、水木资本、中国移动、CPE 源峰等

reported

https://finance.sina.com.cn/stock/t/2026-05-07/doc-inhxanxc8239393.shtml

2026 年 7 月

最新融资及 Pre-IPO 计划报道

具体投资方未形成公开一致口径

reported

https://news.qq.com/rain/a/20260729A0AWPL00

2026 年 9 月

保密递交港股 IPO、探索港沪双重上市

Moonshot;Reuters 引述消息人士 / SCMP

reported

https://www.reuters.com/world/asia-pacific/chinese-ai-firm-moonshot-files-confidentially-hong-kong-ipo-sources-say-2026-09-03/ https://www.reuters.com/world/china/chinese-ai-firm-moonshot-explore-dual-hong-kong-shanghai-ipos-scmp-reports-2026-09-10/

这些来源能够帮助我们还原资本关注度和参与机构的变化,但不能替代交易文件。 对于金额、估值、轮次归属和最终持股,本文只在投资方年报或其他正式文件能够直接支持时才展开;其余一律保留为 reported,不纳入确认的资本曲线。

来源:Alibaba《2024/2025/2026 Form 20-F》pp.F-35–F-36;2023–2026 年融资报道,详见 [[wiki/实习/02_Know2/Kimi研究/01_原始证据/证据摘录_Wave0主体融资监管_260914]];HKEXnews、中国证监会公开入口检索截至 2026-09-15。 网址: https://www.sec.gov/Archives/edgar/data/1577552/000095017024063767/baba-20240331.htm · https://www.sec.gov/Archives/edgar/data/1577552/000095017025090161/baba-20250331.htm · https://www.sec.gov/Archives/edgar/data/1577552/000119312526231755/baba-20260331.htm · https://www.hkexnews.hk/ · https://www.csrc.gov.cn/

7.2 ARR 报道不能替代财务报表

2026 年 7 月报道声称 Moonshot 年化营收从 2026 年 4 月的 2 亿美元上升至 6 月的 3 亿美元。这个数字如果属实,说明商业化叙事正在快速升温;但当前没有公开收入范围、合同口径、客户数量、计算方法、审计报表或现金流,因此应保持 reported。

ARR(Annual Recurring Revenue,年度经常性收入) 指把当前可重复发生的收入年化后的数字。它不是法定会计口径的收入,也不能与 Alibaba 的投资金额相加或相乘,更不能直接拿来计算 P/S(市值 ÷ 收入)、EV/ARR(企业价值 ÷ ARR)或 burn rate(烧钱速度:一年净消耗多少现金)。

未上市 AI 公司的 ARR 尤其需要拆分消费订阅、企业合同、API 用量和一次性服务,否则一个看似精确的数字可能只是不同业务口径的总和。

7.3 API 单位经济:价格已经公开,成本仍然是黑箱

在真实调用数据出现之前,只能先搭建公式:

单请求收入
= (缓存命中输入 token × 命中价
 + 未命中输入 token × 未命中价
 + 输出 token × 输出价) / 1,000,000
 + 工具调用次数 × 工具单价
贡献毛利
= 实际成交收入
 - 推理 GPU / 加速卡成本
 - 专家通信与显存成本
 - 视觉编码与长上下文状态成本
 - 网络、存储、日志、安全和支付成本

真正敏感的变量不是公开标价,而是:有效成交价、输入/输出 token 比例、cache hit rate(缓存命中率 —— 上面那个十倍差价的指标,命中越多成本越低)、Batch 占比、GPU 利用率(同一批卡实际有多少时间在干活,闲置就是白付钱)、MoE 专家通信、视觉 token、Agent 子任务数量、失败重试和工具调用次数。

技术补充|为什么技术效率不等于毛利率 KDA 可能减少长上下文的缓存,MoE 可能降低单 token 的激活计算,Agent Swarm 可能缩短墙钟时间;但一个复杂任务也可能因此调用更多子 Agent、产生更多 token 和工具费用。

所以正确的经济指标或为“每个成功完成任务的有效成本”,而不是某一篇论文里的单项加速数字。论文里的 6 倍吞吐、4.5 倍延迟改善和 2 倍训练效率,必须经过硬件、并发、任务成功率和实际成交价的共同验证。

来源:Kimi API 定价、Batch、工具和限速文档(抓取 2026-09-14);Moonlight、Kimi Linear、K2.5 技术报告;当前未取得 token usage、实际折扣、GPU 利用率、客户合同或审计成本数据。 网址: API 定价 · Batch 定价 · 工具定价 · Moonlight · Kimi Linear · Kimi K2.5


8. 把整条技术路线串起来:它在反复解决五个问题

如果把 2025–2026 年的论文标题全部拿掉,Kimi 的技术路线仍然可以被还原为五个反复出现的工程问题。 这比背模型名字更接近公司真正的研发逻辑。

工程问题

公开方法

解决的直接矛盾

可能的商业含义

当前证据边界

训练太贵、太容易不稳定

Muon、MuonClip、QK-Clip

token 效率、更新尺度、attention logits 爆炸

同预算训练更多实验或更大模型

训练实验为 company_stated

模型总容量与单 token 计算同时变大

MoE、Stable LatentMoE

总参数、激活参数、专家通信与负载均衡

更大的知识容量/能力上限

不等于线上 GPU 成本

历史越长,缓存和解码越贵

MLA、KDA、混合注意力

精确全局访问与有限状态压缩之间的折中

长文档、代码库、Agent 历史的成本控制

不等于所有产品均采用完整配置

模型越深,信息越容易被稀释

AttnRes、Block AttnRes

固定 residual 累加与选择性取用历史层

支持更深模型的训练稳定性

额外内存/通信成本待测

多模态与复杂任务需要更多执行步骤

MoonViT、native vision、Agent Swarm、PARL

视觉细节、任务分解、并行调度与验证

文档、网页、代码和长任务工作流

生产成功率、人工接管率未公开

从这张表可以看到一条连续的因果链:

如果训练效率不够,模型做不大;
如果模型做大但每 token 太贵,服务跑不起;
如果上下文变长但缓存失控,长文本卖点无法规模化;
如果模型变深后信息流变差,扩展会遇到质量瓶颈;
如果模型能看但不能拆任务和执行,复杂知识工作仍然需要人工接管。

Kimi 的公开路线因此更像“模型—kernel—训练基础设施—Agent runtime”的联合优化,而不是单纯追逐参数规模。 这是一条具有连续性的技术假设;但“有连续路线”仍不等于“已形成不可复制护城河”。护城河要由客户数据、真实成本曲线、部署稳定性、组织复用能力和竞争者追赶速度进一步证明。

来源:Moonlight、Kimi-VL、Kimi K2、Kimi Linear、Kimi K2.5、Attention Residuals、Kimi K3 技术报告;Kimi 官方 GitHub 仓库;综合判断详见 [[wiki/实习/02_Know2/Kimi研究/04_研究输出/02_分析中间稿/纵向演变_技术研发_Kimi合成关键维度_260915]]。 网址: Moonlight · Kimi-VL · Kimi K2 · Kimi Linear · Kimi K2.5 · Attention Residuals · Kimi K3


9. 当前的 Kimi:从技术叙事走到商业验证的门口

截至 2026 年 9 月,Kimi 已经公开展示了一条从长上下文到 Agent 执行的连续研发路线,也已经搭出消费、专业工作流、企业、API 和开放模型多个入口;但公司仍处在“技术与产品证据强于财务与治理证据”的阶段。 这不是否定技术,而是准确标注研究能走到哪里。

9.1 当前可以比较有把握地说

  1. 境内存在可核验的北京月之暗面科技有限公司;

  2. 该主体曾以 Moonshot 名义完成生成式 AI 服务备案;

  3. Alibaba 年报确认其对名为 Moonshot 的对象存在约 8 亿美元、约 36% equity interest 的优先股投资;

  4. Kimi 已公开部署多种产品入口和 API 收费机制;

  5. 公开技术材料从训练效率、MoE、视觉、长上下文、Agent 到深度扩展,存在较强路线连续性;

  6. Artificial Analysis 等第三方快照显示 K3/K2.6 已进入前沿模型比较范围,但测量结果受版本、模式、硬件和综合指标影响;

  7. GitHub Stars 与 Hugging Face downloads 提供了生态可见度信号,但不等于用户、客户或收入。

9.2 当前不能说

  1. 境内主体与 Moonshot AI Ltd 已经形成何种完整控制链;

  2. Alibaba 拥有何种投票权、经济权益、转换权或清算优先;

  3. Kimi 有多少 MAU、DAU、付费用户、企业客户和 API token usage;

  4. 2026 年报道中的 ARR 已经由审计报表确认;

  5. K3 的 1M 上下文、104B 激活参数或论文效率数字,等于线上所有请求的真实成本和 SLA(服务等级协议 —— 平台对可用性、延迟等作出的承诺);

  6. IPO 已经公开申报,或媒体报道中的估值已经成为正式交易价格;

  7. K3 的开放权重许可证等同于 MIT/Apache,或者任何托管商都可以不受限制地商用。

9.3 研究状态卡

维度

当前状态

下一份高价值证据

历史与主体

境内主体可确认,境内外映射未闭环

工商变更档案、境外注册文件、组织架构图

资本结构

Alibaba 投资较强确认,其他融资多为报道

cap table、优先股条款、投资方正式披露

技术路线

论文、README、API 页面较丰富

独立复现、完整线上配置、生产硬件数据

产品商业化

入口和价格公开

用户留存、客户双向确认、API usage、续约扩容

单位经济

可搭建公式,无法填入真实变量

实际成交价、GPU-seconds、利用率、贡献毛利

监管与数据

页面条款与历史备案可见

当前模型备案映射、DPA、隔离架构与审计

IPO

Reuters 报道保密递表,未见公开 A1

港交所文件、证监会备案、招股书或公司确认

来源:[[wiki/实习/02_Know2/Kimi研究/04_研究输出/02_分析中间稿/公司截面_Kimi合成关键维度_260915]];[[wiki/实习/02_Know2/Kimi研究/03_主张与缺口/主张台账与缺口报告_260914]];Artificial Analysis K3/K2.6 页面(抓取 2026-09-15);Kimi 官方产品、API 和法律文本。 网址: Artificial Analysis Kimi K3 · Artificial Analysis Kimi K2.6 · Kimi 官网 · Kimi API 模型文档 · Kimi 用户协议 · Kimi 隐私政策


10. 结尾:Kimi 的下一章要由什么证据来写

Kimi 的历史已经从“产品是否有差异化”推进到“技术系统能否在长任务中形成可持续经济性”,下一章不能再靠论文标题或融资传闻单独完成。 接下来最值得等待和主动寻找的证据,可以按五道门排列:

第一扇门:能力

  • 长上下文不同位置的事实召回、逐字复制和多跳推理;

  • 视觉文档、网页、视频和屏幕操作的独立任务成功率;

  • Agent 任务成功率、失败率、人工接管率和结果验证质量。

第二扇门:效率

  • 不同上下文长度、batch、GPU 和并发下的 p50/p95 延迟;

  • 每成功任务的 GPU-seconds、显存、专家通信和视觉 token;

  • KDA、MLA、AttnRes 和 MoE 在实际服务 kernel 中的配置与消融。

第三扇门:采用

  • API token usage 与模型迁移率;

  • 企业客户双向确认、合同金额、续约与扩容;

  • Kimi Work、Code、Claw 的活跃团队或付费席位。

第四扇门:变现

  • 实际成交价、折扣、Batch 占比、缓存命中率;

  • 推理 GPU/加速卡成本、利用率和贡献毛利;

  • 消费、企业、API 三条收入桥的可审计拆分。

第五扇门:资本与治理

  • Moonshot AI Ltd 的注册信息和与境内主体的控制链;

  • 完整 cap table、优先股条款、稀释和关联交易;

  • 公开 A1、招股书、证监会备案和审计财务;

  • 企业数据不训练承诺对应的合同、DPA、隔离架构与审计证据。

因此,对 Kimi 最准确的阶段性结论是:它已经讲清楚了自己的技术路线,也把产品入口铺到了 Agent 和 API,但还没有在公开资料中讲清楚收入质量、成本结构、客户粘性和资本结构。 这家公司下一阶段最关键的里程碑,不一定是再发布一个更大的模型,而是证明长上下文和 Agent 技术确实能在真实工作流中带来可持续的任务完成率与单位经济。

来源:Moonshot 技术报告、Kimi 产品与 API 文档、Alibaba Form 20-F、国家网信办备案公告、Reuters 相关报道及本项目证据覆盖矩阵;未披露项目按 unavailable 处理,未用估计数填补。 网址: Kimi 官网 · Kimi API · Alibaba 2026 Form 20-F · 国家网信办备案公告 · Reuters IPO 报道


附录 A|公开产品与模型节点速览

读表前的记号说明:K = 千,M = 百万,B = 十亿(billion),T = 万亿(trillion);上表的「参数」若未特别标注均为总参数。experts 指 MoE 里的专家个数,top-k(如 top-8、top-16)指每处理一个 token 会从全部专家中挑出几个参与计算 —— 数字越小越省算力,越大则动用的知识越多。1M context 指 100 万 token 的上下文窗口。

按时间排列。「类型」列区分产品发布(用户/开发者什么时候能用上)与技术节点(论文/开源的公开时间)—— 两者常常不是同一天,引用时不可混用。

时间

类型

节点

它在历史中承担的角色

关键公开字段

证据等级

2023-04-17

主体

北京月之暗面科技有限公司成立

境内主体落地

法定代表人杨植麟、注册资本 100 万元

confirmed

2023-10-09

产品

Kimi Chat 智能助手内测

首款面向用户的产品,确立长文本定位

20 万字输入、火山引擎算力合作

reported

2023-11-03

监管

生成式 AI 服务备案(Moonshot)

监管存在感的第一个公开锚点

备案号 Beijing-MoonShot-20231016

confirmed

2024-02-06

产品

开放平台公开测试

从网站变成可被调用的模型服务

moonshot-v1-8k / -32k / -128k 三档 + 定价

reported

2024-03-18

产品

200 万字无损上下文

第一次量级跃迁,产品出圈的触发点

由 20 万字提升至 200 万字,半年 10 倍

reported

2024-10-11

产品

Kimi 探索版

从问答走向带检索的 agent 雏形

单次搜索精读约 500 页

reported

2025-01-19

技术

Kimi-k1.5 GitHub 仓库快照

早期生态信号

仓库元数据

signal

2025-02-24

技术

Moonlight / Muon

从训练效率切入

3B/16B MoE、5.7T tokens、约 2× 计算效率

company_stated

2025-04-10

技术

Kimi-VL / MoonViT

视觉与长上下文结合

约 16B 总参数、约 2.8B 激活、128K context

company_stated

2025-07-03

技术

Kimi K2

稀疏大模型与 Agentic Intelligence

约 1.04T 总参数、约 32.6B 激活、384 experts、top-8

company_stated

2025-07-11

产品

K2 发布并开源

首个万亿参数开源模型,能力首次可被外部独立验证

万亿参数、主打代码与 Agentic

reported

2025-10-30

技术

Kimi Linear / KDA

长上下文进入缓存与吞吐优化

KDA+MLA、1M context、KV cache/吞吐实验

company_stated

2025-11-07

产品

K2 Thinking 开源

从「回答者」向「执行者」转型的公开起点

边思考、边用工具

reported

2026-02-02

技术

Kimi K2.5 / Agent Swarm

从单 Agent 走向并行任务编排

Agent Swarm、PARL、最高约 4.5× 延迟改善

company_stated

2026-03-16

技术

Attention Residuals

深度扩展的信息流优化

输入依赖层间 attention、Block AttnRes

company_stated

2026-07-17

产品

K3 发布并开源

参数规模推到开源模型空前高度

2.8 万亿参数、原生视觉、100 万词元上下文

reported

2026-07-27

技术

Kimi K3

多轴扩展的系统集成

约 2.8T 总参数、104B 激活、896 experts、top-16、1M

company_stated

2026-08-31

产品

kimi-k2.5 与 moonshot-v1 系列下线

第一代 API 模型线正式退场

调用返回 404

confirmed

2026-09-14

技术

API 模型页快照

研发进入平台生命周期管理

K3/K2.7 Code/K2.6 可用,旧模型按日期下线

confirmed page fact

产品时间线的缺口(标记 unavailable):2023 年产品发布的确切日期与官方原文(公众号已撤、官网无历史发布页);moonshot-v1 邀请制开放时间;K2.5(2026-02)的产品发布日(仅有论文与 API 文档,不以论文日期替代);Kimi 浏览器插件、学术版等周边产品上线日期。

来源:技术节点见 Moonshot AI 官方 GitHub / Hugging Face 页面与各 arXiv 技术报告;下线信息见 Kimi API 模型文档。 网址: Moonshot AI GitHub · Moonshot AI Hugging Face · Kimi API 模型文档 · Kimi K3 论文

附录 B|主要来源索引

  1. 北京月之暗面科技有限公司营业执照:https://statics.kimi.ai/moonshot-ai/assets/static/business_license.D2zBa9PM.jpg

  2. Alibaba 2024 Form 20-F:https://www.sec.gov/Archives/edgar/data/1577552/000095017024063767/baba-20240331.htm

  3. Alibaba 2025 Form 20-F:https://www.sec.gov/Archives/edgar/data/1577552/000095017025090161/baba-20250331.htm

  4. Alibaba 2026 Form 20-F:https://www.sec.gov/Archives/edgar/data/1577552/000119312526231755/baba-20260331.htm

  5. 国家网信办 2024 年 4 月备案公告:https://www.cac.gov.cn/2024-04/02/c_1713729983803145.htm

  6. Moonlight:https://arxiv.org/abs/2502.16982

  7. Kimi-VL:https://arxiv.org/abs/2504.07491

  8. Kimi K2:https://arxiv.org/abs/2507.20534

  9. Kimi Linear:https://arxiv.org/abs/2510.26692

  10. Kimi K2.5:https://arxiv.org/abs/2602.02276

  11. Attention Residuals:https://arxiv.org/abs/2603.15031

  12. Kimi K3:https://arxiv.org/abs/2607.24653

  13. Kimi API 模型与定价文档:https://platform.kimi.com/docs/models、https://platform.kimi.com/docs/pricing/chat

  14. Kimi 企业版:https://www.kimi.com/business

  15. Reuters 2026-09-03 Moonshot 港股 IPO 报道:https://www.reuters.com/world/asia-pacific/chinese-ai-firm-moonshot-files-confidentially-hong-kong-ipo-sources-say-2026-09-03/

  16. Reuters 2026-09-10 港沪双重上市报道:https://www.reuters.com/world/china/chinese-ai-firm-moonshot-explore-dual-hong-kong-shanghai-ipos-scmp-reports-2026-09-10/

产品发布时间线来源(2026-09-15 补充)

2023-10 Kimi Chat 的官方原始文章目前可读,作为公司一手口径标记为 company_stated;2024-02 的官方公众号公告目前仍不可读,因此该节点以同期权威媒体转述为主要凭证,标记为 reported。同期媒体报道的原始 HTML 已归档于桌面 实习/实习资料/02_Know2/Kimi/raw/09_产品时间线来源/(18 份,逐文件 SHA-256 见同目录 采集清单.csv)。

  1. 2023-10-09 Kimi Chat 内测(20 万字)— 月之暗面官方微信公众号原始文章(company_stated):https://mp.weixin.qq.com/s/tlzkP0tX17iM0B0toAnZ5g

  2. 同上 — 中国日报网(reported):https://cn.chinadaily.com.cn/a/202310/10/WS652517eaa310d5acd87694a2.html

  3. 同上 — 新浪财经(reported):https://finance.sina.com.cn/jjxw/2023-10-10/doc-imzqriam9850858.shtml

  4. 同上 — 投资界(reported):https://news.pedaily.cn/20231010/70087.shtml

  5. 同上 — 北京日报(reported):https://news.bjd.com.cn/2023/10/10/10588587.shtml

  6. 2024-02-06 开放平台公测(moonshot-v1 三档)— 站长之家(reported):https://www.chinaz.com/2024/0206/1595848.shtml

  7. 2024-03-18 200 万字无损上下文 — 极客公园:https://www.geekpark.net/news/332521

  8. 同上 — 新浪财经:https://finance.sina.com.cn/jjxw/2024-03-18/doc-inantrfp1118734.shtml

  9. 同上(含对月之暗面对话)— 钛媒体:https://www.tmtpost.com/6992507.html

  10. 2024-10-11 Kimi 探索版 — 凤凰科技:https://tech.ifeng.com/c/8daZUQQi9LL

  11. 同上 — 品玩:https://www.pingwest.com/w/299004

  12. 2025-07-11 Kimi K2 发布并开源 — IT之家:https://www.ithome.com/0/867/572.htm

  13. 同上 — 界面新闻:https://www.jiemian.com/article/13025816.html

  14. 2025-11-07 Kimi K2 Thinking 开源 — DoNews:https://www.donews.com/news/detail/4/6240660.html

  15. 同上 — 每日经济新闻:https://www.nbd.com.cn/articles/2025-11-08/4135415.html

  16. 2026-07-17 Kimi K3 开源(2.8 万亿参数)— 北京日报海淀:https://peking.bjd.com.cn/content/s6a5b1f85e4b0e45f3fd4d47b.html

  17. 同上 — 搜狐科技:https://www.sohu.com/a/1055634931_393071

  18. 同上 — 新京报:https://m.bjnews.com.cn/detail/1784264972129096.html

官方源原始 URL