您现在的位置:kastop>> Kas信息 Web3信息>>正文内容

Kimi K3真开源了吗?官方英文说的是Open Weights

作者:硅谷Alan Walker 

quovA6rEizMVyU7CUPWEhst0bIaBf6wCFkhaPMcD.jpeg

2.8 万亿参数权重全球开放,中文通稿说"开源",英文模型卡写的是"open-weight"。硅谷Alan Walker 把 Hugging Face 的许可证标识符、模型卡措辞、K2 与 K3 的发布清单逐字比对了一遍。八条证据,有一条最硬 —— 许可证换了。

今天是 Moonshot 官方定义的"Kimi K3 Open Day"。权重上了 Hugging Face,技术报告上了 GitHub,还附送三件训练基础设施:MoonEP、FlashKDA、AgentEnv。

中文社交媒体上的标题基本统一:3 万亿模型权重全球开放,Kimi K3 开源了。

Alan 的第一反应不是去下载权重——1.56 TB,太大也下不动。相反,Alan 做的第一件事是打开 huggingface.co/moonshotai/Kimi-K3,把页面顶部那一行小字和三个月前的 K2.6 页面并排放在一起看。

然后硅谷Alan Walker 就不太想睡了。

先把清单钉住:放了什么,没放什么

THE MANIFEST · 在下任何判断之前

任何关于"是不是真开源"的争论,如果不先列清单,就是空对空。所以第一段只做一件事:把 7 月 27 日实际交付的东西列出来。

rl2FUkiexLrUczZ8rTr7CDeg4DHLGm6YwNAZtVt9.jpeg

9bqvVbTZ3UpxUempECrCOtzCS6cswbvQyOBc1Thw.jpeg

先说已发布的那部分 —— 含金量是真的高。模型卡里的架构参数值得完整抄一遍,因为这是这次发布里最实在的公共品:

JMCWP1JIvb5vDLY9qRStmLxBF1gJJBqYCRc1PctN.jpeg

清单摆出来,问题就清楚了。这不是"开不开源"的是非题,是 开了几档的程度题。而 K3 这一档,比 Moonshot 自己一年前的 K2 那一档要窄。

判断一次发布是否"真开源",别看它放了什么 —— 看它上一次放了什么,这次少放了什么。

最硬的一条:许可证换了

THE LICENSE SWITCH · modified-mit → kimi-k3

这是 Alan 认为整件事里最实质、也最少人注意到的变化。

Hugging Face 的模型页顶部会显示一行许可证标识符。这是机器可读的元数据,不是营销文案。我把三个仓库的这一行拉出来:

oyKUuoHOPzh6PP6rqf1rzwfzQ4eA1ZyuWDr9CseK.jpeg

数据来源:Hugging Face各模型页面元数据与模型卡正文,2026年7月27日抓取。

modified-mitkimi-k3,这是一次 从"某个已知许可证的变体"退到"一份公司自定义合同" 的迁移。

为什么这很重要,Alan 用三层解释:

第一层:SPDX 标识符消失了

modified-mit 虽然不是 OSI 认证的许可证,但它是一个在 Hugging Face 生态里被广泛使用、条款高度标准化的标签——业界都知道它大致是"MIT 加一条署名条款"。而 kimi-k3 是一个只属于这一个模型的独占标识符。任何自动化的合规扫描工具(企业法务用的那类)遇到它,都只能返回"未知许可证,需人工审阅"。

对个人开发者,这没区别。对任何有法务流程的公司,这是一道全新的闸门。

第二层:文件变大了三倍

仓库文件列表里,LICENSE 的大小是 3.07 kB。

作为参照:标准 MIT 许可证全文大约 1.1 kB;K2 那版 Modified MIT(MIT 全文 + 一段署名要求)大约 1.5 kB。3.07 kB 意味着在 MIT 的基础上,多写了将近两千字节的条款。

两千字节能写什么?以 K2 那条著名的附加条款为例——"若产品月活超过 1 亿或月收入超过 2000 万美元,须在用户界面显著位置标注 Kimi"——这一整段大约 400 字节。3.07 kB 的空间,够放下五到七条这个量级的条款。

第三层:官方公告里的那半句话

Moonshot 中文公告原文(经翻译核对)写的是:

所有人现在都可以下载并部署 Kimi K3 模型,无论是用于内部研发,还是集成进面向终端用户的产品。对于其他用途,请参见 Kimi K3 License。来源:Moonshot AI 官方发布公告,2026 年 7 月 27 日

请把最后一句读三遍。

MIT 许可证的精神是穷举式授权 —— "允许任何人无限制地处置本软件",然后只列极少数条件。它不需要"其他用途请参见"这样的句式,因为它没有"其他用途"这个概念。

而"内部研发和集成进终端产品可以,其他用途请看许可证"这个结构,是枚举式授权:先划两个安全区,剩下的留在合同里逐条谈。这两种句式背后是两种完全不同的法律哲学。

我没有读到 Kimi K3 License 的完整条款正文。Hugging Face 的 LICENSE 文件在我抓取时返回 401。所以以上三层推断,建立在三个可核实的事实上:许可证标识符从 modified-mit 变为 kimi-k3;文件大小 3.07 kB;官方公告使用了"其他用途请参见"的句式。

我没有断言其中包含任何具体的限制条款。它完全有可能只是把 K2 的署名条款写得更细,甚至可能比 Modified MIT 更宽松。发稿前请自行打开该文件通读 —— 这也正是我这篇文章最想传达的方法论:不要读推文,去读 LICENSE 文件。


他们自己已经不说"open source"了

THE WORD SWAP · 一个词的迁移,以及中英双轨

这一条是文本比对,任何人都能自己验证。


cNmS6vBr8hoHFoWXZu5Bp2A2qCCGcRzRN8PEikqU.jpeg

这就是 Alan 要指出的核心不对称:英文里,他们把自己从 open-source 改成了 open-weight。中文里,通稿依然叫"开源"。同一家公司,同一天,两种措辞。

Alan 不认为这是欺骗,他认为这是 一次法律上的谨慎,加上一次传播上的惯性。英文模型卡是要给全球企业法务看的,写 open-source 有实质法律风险——因为 OSI 对这个词有明确定义,而 K3 不符合。中文通稿面向的是舆论场,"开源"在中文互联网早已泛化成"免费能下载"的同义词,改口反而没人看得懂。

但结果是:最了解自己发布性质的人已经改了口,而最热情传播它的人没有。这两者之间的落差,就是这篇文章存在的理由。

顺便给一个权威锚点。2026 年《国际人工智能安全报告》里有一段定性写得非常干净,大意是:虽然常被称为"开源",但大多数公开发布的模型更准确的描述是"开放权重" —— 因为开发方提供了权重,却没有发布配套的训练代码或数据集。报告同时点名 Meta 的 Llama 系列因许可条款带有限制、且只提供推理代码不提供训练代码,通常不被视为开源。

Moonshot 的英文措辞,正好和这份报告的定性对齐了。这不是巧合。

插曲:Alan 去找"社区真实反馈",找到的是一篇机器写的稿子

写这篇文章时,原计划用一整段来呈现开发者社区和 X 上的真实反应。结果这一段变成了另一个发现。

Alan 抓了二十多篇在搜索结果里排名靠前的"Kimi K3 深度解析""K3 自托管指南""K3 开源意味着什么"。它们看上去都像技术博客:有小标题,有代码块,有"我们交叉验证了 Moonshot 的官方公告"这样的方法论声明。

然后他把它们和 Hugging Face 页面上的一手数据对了一遍:

ZGqKFnXIbHu7A3AhRuyr8RgovgmKZODeAKIDqIWK.jpeg

这些文章里,有几篇甚至煞有介事地写着"我们追踪了 Moonshot 的 GitHub 组织,交叉核对了开放权重时间线” —— 然后给出一个不存在的仓库名。

这是一个比"Kimi 是不是真开源"更让人不安的发现:

围绕一次重大技术发布第一时间涌现的"社区讨论",相当大的比例是模型生成的、以 SEO 为目的的、事实错误的内容。

它们互相引用、互相加固,在真人开始下载权重之前就把搜索结果占满了。

最讽刺的部分在这里:一个开放权重模型发布后的第一批"社区反馈",是由开放权重模型批量生产的。

那么真实的反馈在哪?在几个很窄的地方 —— vLLM 和 SGLang 的 PR 讨论区、Hugging Face 该仓库下的 34 个 discussion、以及推理服务商的实测数据。这些地方的信号密度极高,噪声极低,但它们不会出现在你的信息流里。

顺带一提,Hugging Face 页面上有一行状态很说明问题:"This model isn't deployed by any Inference Provider." 旁边是 64 个用户点击的"请求服务商支持"。这才是真实的社区行为 —— 不是发帖夸奖,是排队等着能用上。

Base 模型消失了

THE MISSING BASE · 从"基座 + 后训练"到"只有一个"

这一条,是 Alan 认为对研究者伤害最大、但被讨论最少的一条。

先看 Kimi K2 技术报告的摘要,原文大意是:为推动智能体智能的进一步发展,他们开源了基座检查点和后训练检查点,以便社区探索、改进和大规模部署。同一份报告还明确写了:K2 的基座模型在 15.5 万亿 高质量 token 上完成预训练,全程零 loss spike。

Hugging Face 上至今能找到 moonshotai/Kimi-K2-Base,许可标签 modified-mit。

K3 呢?moonshotai组织下只有一个 Kimi-K3仓库。而这个模型是什么形态,模型卡自己说得很清楚:

MwrhHWOLX63V4e9zJNrVMbv1hcv3cjVirvM6Opms.jpeg

没有 base 意味着什么

对做产品的人,没影响 —— 你本来就要用对齐好的模型。

对做研究的人,影响是致命的三条:

一、无法做真正的继续预训练。

在一个已经 RLHF 过、思维链常开的模型上做领域继续预训练,会和已有的对齐目标打架,这是行业常识。想把 K3 变成一个医疗基座或法律基座,你缺的是那个还没被塑形的原始模型。

二、无法做独立的对齐研究。

研究"对齐前后模型行为差异"这类课题,需要至少两个检查点。只给终点,研究者只能推测起点。Moonshot 在技术报告里把后训练方法写得再详细,也无法替代"你自己拿 base 跑一遍"。

三、无法验证他们的核心宣称。

K3 最大的技术卖点是"每单位算力产出约 2.5 倍智能"。这是一个关于 预训练效率 的宣称。而验证预训练效率,唯一的方式是拿到基座模型跑标准评测。他们发布的是后训练模型,也就是说,这个最核心的宣称在结构上无法被外部独立验证。

K2 给了你起点和终点,K3 只给了终点。前者叫开放研究,后者叫开放部署。

拿 OSAID 逐条对表:三条全不满足

THE DEFINITION TEST · 开源到底有没有客观标准

"开源"这个词不是文学修辞,它有一个国际公认的守门人:开放源代码促进会(OSI)。OSI 在 2024 年 10 月发布了《开源人工智能定义 1.0》(OSAID 1.0),2026 年第四季度前还计划修订到 1.1 或 2.0。

OSAID 1.0 要求一个"开源 AI 系统"必须同时提供三样东西。我逐条对 K3 打分:

参数(Parameters)—— 部分满足

OSAID 要求"模型参数,如权重或其他配置设置,须在 OSI 认可的条款下提供"。K3 的权重确实公开了、可下载、可修改、可商用。但 "OSI 认可的条款" 这半句不满足—— kimi-k3 不是 OSI 认可的许可证,modified-mit 也不是。这一条严格讲只能算半分。



代码(Code)—— 不满足

OSAID 的原文要求极其严格:"完整的、用于训练和运行该系统的源代码。代码须完整体现数据是如何被处理和过滤的,以及训练是如何进行的。"并且明确列举了必须包含:数据处理与过滤代码、训练代码(含所用参数与设置)、验证与测试代码、分词器等支撑库、超参搜索代码、推理代码、模型架构。K3 提供了架构与推理代码,训练管线一行没有。MoonEP、FlashKDA、AgentEnv 是三个零件,不是那条流水线(下一段详述)。

数据信息(Data Information)—— 不满足

OSAID 的这条已经是妥协后的版本了 —— 它不要求公开训练数据本身,只要求"足够详细的关于训练数据的信息,使得一位熟练的从业者能够构建一个实质等价的系统"。自由软件基金会和软件自由保护协会当年公开反对过这个妥协,认为标准定得太低。即便是这个被批评为太低的标准,K3 也没达到。K2 至少公布了 15.5 万亿 token 的预训练规模,K3 的官方公告和模型卡里,关于训练数据的信息量是零。



三条里,一条半满足,两条不满足。结论在定义层面是没有争议的:

按 OSI 的标准,Kimi K3 不是开源 AI。它是一次规模空前的开放权重发布 —— 这两件事不是同一件事,而且差得不是一点。

需要说明的是,这个结论对绝大多数中国大模型同样成立:DeepSeek、Qwen、GLM 全都不满足 OSAID 的代码与数据信息条款。真正满足全部三条的模型,全世界屈指可数(Allen AI 的 OLMo 系列是少数样本)。

所以 Alan 不是在说 Moonshot 特别不老实。Alan 是在说:整个行业都在用一个被掏空的词,而 K3 是这个词被掏空之后,规模最大的一次使用。

三件"开源基建"的含金量,得分三档

THE INFRA · 复述、追赶、外挂

官方公告把 MoonEP、FlashKDA、AgentEnv 并列为"支撑 Kimi K3 训练的关键基础设施技术"。听起来是三件重礼。拆开看,含金量差别很大。

FlashKDA —— 这不是新东西

公告自己写得很清楚:FlashKDA 此前已经开源,MoonEP 和 AgentEnv 是随本次发布正式开源的。

FlashKDA 的实际开源时间是 2026 年 4 月 22 日,比 K3 权重早了三个多月,MIT 许可,独立仓库。它是 Kimi Delta Attention 的 CUTLASS 高性能算子实现,在 NVIDIA H20 上相比 flash-linear-attention 基线,prefill 速度快 1.72–2.22 倍,可以直接作为 flash-linear-attention 的替换后端使用,安装后从 chunk_kda 自动分发。

这是一个货真价实的好贡献。但把它放进"今天我们开源三件基建"的清单里,是 复述,不是 新增。传播链条上,绝大多数读者会以为今天开源了三样新东西,实际是两样。

MoonEP —— 真新,但晚了一年半

MoonEP 是面向超大规模、细粒度 MoE 模型的高性能通信库,让专家并行通信在负载不均衡时仍能保持高效率。这确实是这次最有价值的新增。896 个专家、每 token 激活 16 个,通信不均衡是这个架构最要命的工程问题。

但看名字你就该想到另一个东西:

DeepSeek 的 DeepEP —— 同样是专家并行通信库,在 2025 年 2 月的"开源周"就已经放出来了。

MoonEP 之于 DeepEP,是 追赶,不是开创。这不减损它的工程价值,但它说明一件事:在"把训练基建交出去"这条路上,Moonshot 走在 DeepSeek 身后一年半。

AgentEnv —— 甚至不在自己名下

AgentEnv 是与 KVCache.ai 联合开发的大规模 agent 环境沙箱系统,为 K3 后训练提供高保真、强隔离的沙箱,支持快照、恢复、fork,面向大规模并行 agent 工作流。

注意仓库地址:github.com/kvcache-ai/AgentEnv。

它不在 MoonshotAI 组织下。这是一个联合项目,Moonshot 是共同贡献方而非唯一所有方。把它计入"我们今天开源的三件基建",在归属上是有拉伸的。

最关键的一点:这三样都不是训练 K3 的那套代码

通信库、算子、沙箱——这是三个零件。而 OSAID 要的是"完整的、用于训练和运行该系统的源代码,须完整体现数据是如何被处理和过滤的,以及训练是如何进行的"。

给你发动机、变速箱和试车跑道,不等于给你造车的图纸。三件基建是零件,不是那条流水线。

基准表的口径战争

THE BENCHMARK FINE PRINT · 脚注比表格诚实

K3 的模型卡贴了一张 42 行的评测表,对手是 Claude Fable 5、GPT-5.6 Sol、Claude Opus 4.8、GPT-5.5、GLM-5.2。这张表在中文社交媒体上被大量转发,配文通常是"全面超越"。

Alan 把脚注读完了。脚注比表格诚实得多,而且这一点必须说公道话 —— Moonshot 主动披露了大量对自己不利的方法学细节。这在中国大模型的发布里是少见的。

但既然披露了,就得读。

9eE41dbxnvIAUVpYHcdQqAGSoSuobBIszPLt3QaF.jpeg

hcjUrX9HECMh4VbOycQheISfmtnlkTEixUZzJL2A.jpeg

然后看真实的胜负分布

如果不看标题只看表格:在 42 行评测里,K3 输给 Claude Fable 5 的项目包括 HLE-Full、DeepSWE、FrontierSWE、PostTrainBench、MLS-Bench-Lite、SciCode、Kimi Code Bench 2.0(自家基准)、GDPval-AA v2、Toolathlon、APEX-Agents、OfficeQA Pro、OSWorld 2.0、Legal Research Bench、BabyVision、CharXiv、MathVision、ZeroBench……

K3 明确领先的地方也很实:BrowseComp(91.2 vs 88.0)、MCPMark(94.5 vs 87.4)、SWE-Marathon(42.0 vs 35.0)、τ³-Banking(33.4 vs 26.8)、Harvey Lab-AA(94.6 vs 93.6)、OmniDocBench、AutomationBench。

准确的表述是:K3 在浏览、MCP 工具调用、长程工程任务上确有优势,在深度推理和综合知识工作上仍落后于 Fable 5。这已经是极其了不起的成绩 —— 一个开放权重模型跑到这个位置,一年前不可想象。

但它不是"全面超越"。而"全面超越"是中文传播链条上的默认版本。

最诚实的信息永远在脚注里,最不诚实的信息永远在转发的配图上。

动机拆解:为什么"开放权重"是一个极其理性的选择

THE MOTIVE · 商业、竞争、生态位、地缘

这一段 Alan 不谈道德,只谈利益结构。因为一旦你把利益结构画清楚,你会发现 Moonshot 这么做。

完全理性,而且大概率是对的。

一、商业:开放权重是最便宜的获客

K3 于 7 月 16 日上线 API,7 月 27 日放权重。中间有 11 天的独占期 —— 这 11 天里,所有想用 K3 的人只能付费调 API。

结果:K3 发布以来,Moonshot 的日收入增长了至少 6 倍公司 6 月的年化经常性收入(ARR)达到 3 亿美元,4 月还是 2 亿。目前正在以 500 亿美元 估值募集新一轮,并可能最早今年在香港 IPO。

创始人杨植麟的公开表述是:他希望通过比美国专有系统更开放、更易获取来赢得用户。这不是理想主义宣言,这是 一条已经被验证的获客路径。

而且注意定价结构:$3.00/百万 token 输入、$0.30/百万 token 缓存命中输入、$15.00/百万 token 输出。缓存命中率只有未命中的十分之一,靠的是他们自己的 Mooncake 分离式推理架构 —— 在编码类工作负载上,缓存命中率据称达 90%。权重开放了,但把权重跑到这个成本结构的那套东西没开放。这才是真正的护城河所在。

二、竞争:一次精准的定向爆破

K3 首发当天,港股市场的反应是:Z.ai 一度跌 30%,MiniMax 集团一度跌 16%,阿里巴巴跌 4%

这不是对美国实验室的打击 —— OpenAI 和 Anthropic 没上市,K3 的定价压力对它们是慢性的。这是对中国同行的打击。在一个正准备 IPO 的窗口期,把同赛道竞争者的估值锚打下来,是最直接的资本市场操作。

三、生态位:抢的是"默认选项"这个位置

OpenRouter 的路由 token 份额已经出现了历史性反转:中国模型占 46.4%,美国模型占 35.7%,DeepSeek 单家就占 17.6%。

在这个格局里,"世界上最大的开放权重模型"这个标签的价值,不在于有多少人真的下载它 —— 首月下载量只有 2,850 次,因为 1.56 TB 谁下得动 —— 而在于它把 Moonshot 放在了 全球开源 AI 开发者社区引力中心 的位置上。这是一个叙事资产,不是一个流量资产。

四、地缘:一个 Alan 认为被严重低估的时间点

这一段的事实必须严格陈述:

7 月 20 日,Axios 报道特朗普政府正考虑限制美国境内对中国先进 AI 模型的访问,K3 被明确点名,阿里 Qwen 也在名单上。AI 事务负责人 David Sacks 是主要推动声音之一,理由是中国的开放权重模型 —— 正因为任何人都能下载、定制、运行 —— 正在加速中国在全球 AI 扩散中的地位。

7 月 22 日,白宫科技政策办公室主任 Michael Kratsios 公开指控 Moonshot 大规模隐蔽蒸馏 Anthropic 的 Fable 模型来构建 K3,并指控其经由泰国基础设施获取受禁的 NVIDIA GB300 芯片。财政部长 Bessent 另行威胁对通过蒸馏提取美国模型能力的中国 AI 公司实施制裁乃至列入实体清单。工业与安全局(BIS)已正式立案调查。

关于蒸馏指控的处理

截至目前,没有任何支持性日志或证据被公开。Moonshot 未就 7 月 22 日的指控作出公开回应。

多位 AI 研究者已公开质疑该指控的时间线:Anthropic 的 Fable 5 于 2026 年 7 月 1 日才公开可用,而 K3 在 7 月 15—17 日发布 —— 中间只有两周,训练一个 2.8T 模型不可能在这个窗口内完成。

本文在此按"美国政府官员的公开指控、当事方未回应、无公开证据、时间线存疑"处理,不作为事实陈述。截至 7 月 25 日无执法行动,权重发布按原计划进行。

把时间线并排看,你会得到一个很难忽略的结论:

在华盛顿正讨论要不要禁掉你的时候,把权重不可逆地撒向全世界 —— 这是防御性的最优解。已经下载到几千台服务器上的东西,任何行政命令都收不回去。

Tom's Hardware 的读者评论区里有一条把这个悖论说得最直白,大意是:禁用中国云服务商可以理解,因为数据要传出去;但一个自己托管的开放权重模型,安全风险到底在哪?

这正是政策制定者面临的结构性难题 —— 而 Moonshot 在 7 月 27 日凌晨 00:00 UTC 按原计划发布权重这个动作,把这个难题永久固化了。

五、"对谁开放"这个问题,答案不是"所有人"

这一条必须单独拎出来,因为它是"开放权重"这个词最容易被误读的地方。

ssUHMMtc2GB2bLzoeMs4EywGqZJt1WAvEO1RfZc8.jpeg

2,850 这个数字和 146 万那个数字的对比,把整件事说透了:K2.6 是一个开发者能真正拿走的模型,K3 不是。

K3 的"开放",实际受益者是三类主体:云推理服务商、有自建算力的大型企业、以及要做数据主权部署的政府机构。个人开发者、小团队、研究生实验室,一个都不在里面。

这不是批评 —— 2.8T 的模型物理上就是这样。但它意味着一件事:"开放权重"在 2026 年已经不再是一个平权工具了。它是一个 B2B 分发渠道,只是这个渠道不收钱。

而渠道确实通了,速度快得惊人。权重发布当天,Fireworks 已经把 K3 跑到 45 token/秒、首字延迟 1.44 秒;Together AI 和 Modal 提供了 day-0 托管。一位开发者在 X 上的原话大意是:他花了十一天等这个模型说出第一个字,痛苦到反复关掉标签页,而权重一放出来,整个行业当天就替 Moonshot 把问题修好了。

这是开放权重最真实的价值 —— 不是让每个人都能跑,是让每个人都能被服务。

六、还有一层:许可证本身就是分发策略

回想 2025 年那场 Cursor Composer 2 风波:社区通过模型指纹发现 Cursor 的旗舰多文件编辑功能跑在 Kimi K2.5 上,而 Cursor 从未在变更日志、文档或任何公开场合披露过。

Modified MIT 里那条"月活过亿或月收入超 2000 万美元须在界面显著标注 Kimi"的条款,设计目的就是解决这个问题 ——它不是一条限制条款,它是一条品牌分发条款。你越成功地把 Kimi 用进产品里,你就越必须替它打广告。

如果 3.07 kB 的 Kimi K3 License 里保留并强化了这一类条款,那么"开放权重"本身就是 Moonshot 最大的一次营销投放 —— 成本是权重,收益是全球每一个用它的产品界面上的那行字。

反方 · 我可能错在哪 里

这一节针对的是这篇文章本身的立场。我尽量写得比正文更狠。

一、"不是 OSI 开源"这个结论,可能是在用一把过时的尺子量东西。OSAID 1.0 是 2024 年 10 月定的,OSI 自己都承认它有问题,计划在 2026 年第四季度前修订到 1.1 或 2.0,主要争议点正是"数据信息"那条妥协。自由软件基金会当年反对它太松,而在实践中它又被批评太严——严到全世界几乎没有一个前沿模型能通过。一个没有任何前沿模型能满足的定义,究竟是模型不够开放,还是定义不够有用?我在正文里默认了前者,但这不是显然的。

二、我可能高估了"许可证换名"的信号价值。我全部三层推断,建立在标识符变化、文件大小和一句"其他用途请参见"上。我没有读到条款正文。完全存在这样一种可能:Kimi K3 License 只是把 Modified MIT 的署名条款写得更清楚、把免责声明补全、加上一段与出口管制合规相关的常规表述——3.07 kB 装这些绰绰有余,而且实质上比 K2 更宽松。如果是这样,我这篇文章最硬的一条证据就垮了一半。这是我在发稿时最大的不确定性,我把它明写在这里。

三、把"开放权重不等于开源"当成批评,可能本身就是一种精英主义。对于全球绝大多数使用者——想在自己机房里跑一个不受美国云约束的前沿模型的政府、想做数据主权部署的欧洲企业、买不起 Claude 的东南亚开发者——他们要的从来不是训练代码和数据配比,是一个能下载、能自托管、能商用的强模型。K3 完整地给了这个。Fireworks 在权重发布当天就把服务跑到了 45 token/秒、1.44 秒首字延迟;Together AI 和 Modal 提供了 day-0 托管。这就是开放权重实实在在的价值兑现,而它发生在几小时之内。我花了八段去纠结一个词的定义,而世界在这八段的时间里已经把它用起来了。

四、我对"没有 base 模型"的指责,可能站在了一个已经消失的时代。当模型规模到 2.8T、后训练的价值占比越来越高、且预训练与后训练的边界越来越模糊时,"发布 base 检查点"这个动作本身可能正在失去意义。没有任何一个外部团队有能力在一个 2.8T 的 base 上做有意义的继续预训练——那需要的算力,全世界不超过二十家机构有。我在要求一个只有二十家机构能消费的公共品。

五、最后一条,也是最不舒服的一条。这篇文章的选题本身带着一个预设:中国公司说"开源"的时候,值得多查一层。但如果我把同样的显微镜对准 Meta 的 Llama、对准 Mistral、对准 Google 的 Gemma,我会找到同样多甚至更多的问题——Llama 的社区许可证有月活 7 亿的使用限制、有禁止用于改进其他模型的条款,这些比 K3 目前已知的任何东西都更不"开源"。我选择了写 K3 而不是写 Llama,是因为 K3 今天发布。但读者有权知道:这把尺子如果只对一类公司使用,它就不是尺子,是武器。

所以,回到标题那个问题:Kimi K3 真开源了吗?

按 OSI 的定义,没有。

训练代码没给,数据信息没给,许可证不是 OSI 认可的。三条硬标准,一条半。

按 Moonshot 自己一年前的标准,退步了K2 给了 base 加后训练两个检查点、给了 15.5 万亿 token 的预训练规模、给了 Modified MIT。K3 给了一个后训练检查点、零数据信息、一份自定义合同。

按"这个词在中文互联网上实际的意思",那它开源了能下载,能自托管,能商用,能微调。绝大多数人要的就是这些,而 K3 在这个层面上做到了历史上任何一个模型都没做到的规模。

三个答案都对。这才是真正扎心的地方 ——不是 Moonshot 在偷换概念,是"开源"这个词已经被整个行业掏空到,同一个发布可以同时是"真的"和"假的"。

Moonshot 的英文文案已经悄悄改口叫 open-weight 了。他们比传播他们的人更清楚自己发布了什么。

下一次再看到"某某模型开源了"的标题,你只需要做一件事:打开那个 LICENSE 文件,读完它,再决定要不要转发三千字节而已,比你转发之后要承担的东西便宜多了。



感动 同情 无聊 愤怒 搞笑 难过 高兴 路过
【字体: 】【收藏】【打印文章】 【 打赏 】 【查看评论

相关文章

    没有相关内容