核心判断
架构主线成立
KDA + 周期性 MLA、Block AttnRes、Stable LatentMoE 分别处理序列、深度、宽度的信息流。公开配置与 96 个权重分片支持这些结构事实。
能力重心很明确
相对同表模型,K3 在 agentic 与 coding 上最强,reasoning 是最清楚的短板。50 个子指标的逐项比较比挑几个 headline 更有解释力。
开放仍有边界
主权重已开放,但训练配方无法完整重建,EAGLE-3 草稿模型未随主仓库发布,自定义许可证也带有大规模商业使用条件。
K3 最值得重视的不是“又一个万亿参数 MoE”,而是它把有限状态注意力、深度路由、极稀疏专家、长程后训练和状态化推理系统连成了一个闭环;最需要保留怀疑的则是 2.5× 缩放效率的归因、训练可复现性和跨异构 harness 的横向榜单。
先把发布物对齐:博客、报告和权重不是同一时间切片
官方博客是 2026-07-16 的首发叙事,技术报告在 2026-07-28 继续更新,公开主权重于 2026-07-27 落地。博客正文仍写着“完整权重将在 7 月 27 日发布、技术报告即将到来”,说明它没有随发布状态同步重写。技术判断应优先使用较晚的报告与模型仓库,并保留博客作为首发口径。
| 材料 | 可核验内容 | 主要边界 | 本篇用法 |
|---|---|---|---|
| 官方博客 | 产品定位、API 价格、案例与首发 benchmark 表 | 未来时态已过期;部分分数与后续报告不同 | 首发快照,不与报告数字混写 |
| 47 页技术报告 | 架构、训练、后训练、基础设施、评测协议与附录推导 | 大部分实验仍是发布方自报;缺少训练预算和完整大模型消融 | 机制与实验的主要来源 |
| 公开模型仓库 | 配置、代码、许可证、权重索引与精度格式 | 没有训练数据、训练日志和报告所述草稿模型 | 验证“发布了什么、结构到底是什么” |
| 部署文档 | 当前硬件组合、服务参数、支持模态与待验证项 | 部分 recipe 标注仍在最终验证 | 约束实际可部署范围 |
对博客和报告重叠的评测单元逐格比对,共发现 13 个数值差异;其中 K3 自身有三处:GDPval 从 1668 更新为 1686,Toolathlon 从 73.2 更新为 76.5,JobBench 从 52.9 更新为 54.3。其余差异还包含基线模型和小数舍入。它们不必然意味着错误,更可能是 rerun、harness 或版本更新;但足以说明任何比较都必须带上材料日期。
模型画像:真正稀疏的是计算,不是存储
104.2B 只占 2.78T 的约 3.75%,总参数与激活参数之比约为 26.68×。与 K2 相比,总参数增长 2.67×、激活参数增长 3.20×、层数增长 1.52×。这意味着 K3 并不是只增加“冷专家”;单 token 的真实计算规模也大幅上升。
公开权重索引合计约 1.56 TB(1.42 TiB)。只把权重均摊,8 / 16 / 32 / 64 张卡分别约需 181.7 / 90.9 / 45.4 / 22.7 GiB 每卡,还没有计入运行时 buffer、KV cache、通信空间和视觉编码。因此“MoE 只激活 104B”不能推导出单机轻松部署;稀疏激活降低算力,并不消除全量权重的存储和通信成本。
架构总纲:在三个正交方向上学习“信息该去哪里”
序列方向
69 层 KDA 用固定大小的递归状态压缩历史,24 层 Gated MLA 周期性提供全局回看,避免纯线性注意力把所有历史都挤进有限状态。
深度方向
Block AttnRes 不再让每层无差别累加全部前层输出,而是按输入内容选择早期 block 表征,缓解 PreNorm 的幅值增长和信号稀释。
宽度方向
Stable LatentMoE 先把 7168 维隐藏状态压到 3584 维,再在 896 个专家中选 16 个,以更低的专家计算宽度换取更大的专家池。
传统 Transformer 主要在 token 之间做注意力;K3 把“选择”扩展到三个轴:从哪些历史 token 取信息、从哪些前层取信息、由哪些专家变换信息。它不是三个孤立技巧的堆叠,而是在序列、深度、宽度上都用稀疏或可学习路由替代均匀流动。
KDA + Gated MLA:固定状态与全局纠偏
93 层按“三层 KDA、一层 MLA”的节奏排列,并在末层额外放置一层 MLA,最终得到 69 + 24。KDA 基于 delta rule 更新矩阵状态,带逐通道遗忘和输入依赖输出门;它的状态大小不随序列长度线性增长,因此长上下文解码不需要为每个历史 token 保留完整 KV。
K3 把衰减对数下界设为 g_min = -5。这看似是数值细节,实质是 kernel 设计条件:16-token tile 内的倒数尺度被约束在 BF16 可表达范围,原本依赖 token 对角矩阵的计算可重写为 Tensor Core 友好的稠密乘法。周期性 MLA 则保留全局、内容寻址的通道。两者组合承认了一个事实:固定状态高效,但有限记忆不可避免;全注意力昂贵,却适合纠正长期压缩误差。
Block AttnRes:把残差流变成深度检索
标准 PreNorm 残差以单位权重把各层输出持续累加,深度增加时隐藏幅值会增长,单层贡献被越来越大的累计流稀释。AttnRes 让当前层对更早的输出计算 softmax 权重。完整版本需保存全部层表征,内存与通信为 O(Ld);block 版本只保留 block 级表示,降到 O(Nd)。
K3 以 12 层为一组,93 层形成 8 个 block(最后一组不满),再加 embedding,共 9 个可检索源。它获得的不是“更长 token 上下文”,而是更可控的深度上下文:后层能回取适合当前 token 的早期抽象,而不是被迫接受同一条混合残差流。
Stable LatentMoE:极稀疏路由必须与稳定性机制一起看
每层有 896 个 routed experts,每个 token 只选 16 个,专家选择率为 1.79%,即 1/56;另有两个全宽 shared experts。路由专家在 3584 维 latent space 工作,宽度正好是 7168 隐藏维的一半,随后再映射回全宽。这个设计借鉴了 NVIDIA LatentMoE 的“在低维空间增加专家数量”思想,但 K3 为更大专家池加入了三项稳定化。
Quantile Balancing 解决的不是“平均公平”,而是系统吞吐
传统无辅助损失路由通过固定步长更新专家 bias:过热就减、过冷就加。896 个专家时,步长过小跟不上分布,过大又产生负载振荡。QB 把每个专家的 bias 设为能匹配目标负载的 router-score 分位数;下一步再用这个因果可用的估计路由。它不需要手调步长,且在训练结束后冻结 bias 用于推理。
大规模实现没有传输全部 margin,而是用 1000 个 histogram bins 估计分位数,每层每步只需一次整数 all-reduce。报告声称通信低于传原始 margin 的 1%,误差由 bin 宽约束。这项主张有清楚的算法与复杂度推导,但没有单独公开 K3 大模型上的负载曲线、吞吐差和消融误差条。
报告正文称“引入 QB”,但附录明确说推导 follow Jianlin Su 2026 年 2 月关于最优平衡分配的文章,并追溯到 BASE Layers 与 BIP。更稳妥的判断是:K3 的贡献在于把这一对偶 / 分位数思路做成适配 896 专家的可扩展直方图估计并集成到训练系统,而不是从零发明整个最优分配视角。
SiTU-GLU 是软保险丝,不是表达力口号
SiTU 对两条 GLU 分支分别用 sigmoid 与 tanh 软限制,报告设置 β₁=4、β₂=25,单坐标输出有不超过 100 的上界。与 hard clamp 相比,它保留连续导数;与无界 SwiGLU 相比,它牺牲部分极端幅值换取大规模 MoE 训练不爆炸。RMSNorm、SiTU 和 QB 分别管聚合尺度、单专家激活和专家负载,三者共同构成稳定性闭环,不能把收敛归因于其中一个。
原生多模态:训练主张比公开服务接口走得更远
MoonViT-V2 有 27 层、401M 参数、1024 隐藏维、14×14 patch,并用 2×2 pixel shuffle 压缩视觉 token。报告称视觉编码器不从 SigLIP 初始化,而是从随机权重开始,与语言模型的 next-token objective 联合训练;图片最高可到 3584×3584,图片与视频共享参数,视频增加时间注意力和池化。
这里需要区分三层事实:
- 架构与训练层:报告明确描述 image + video 的原生联合训练。
- 公开主仓库层:模型卡列出的公开模态是 Text、Image,配置和视觉代码可核验。
- 当前服务实现层:官方集成文档的 processor 明确拒绝 video / audio 输入,当前可直接部署的公共 contract 是图片,而非完整视频通路。
报告用视觉梯度范数曲线说明从零训练没有失稳,并称下游能力与 SigLIP 初始化相当;但没有给出两者的数值表、训练预算控制和置信区间。因此,“从零联合训练可行”有运行证据,“等价或更好”仍是缺少公开消融的发布方判断。
“2.5× scaling efficiency”到底说了什么,又没说什么
报告 Figure 7 把若干缩放实验的 OOD validation loss 对训练 FLOPs 拟合成曲线,并称 K3 架构与训练配方相对 K2 产生约 2.5× 的横向效率迁移。最合理的读法是:在这套拟合下,达到相同验证损失所需的训练计算约缩小到 1/2.5。
可以支持
组合方案在发布方缩放实验中表现出更好的 loss–compute 前沿;K3 不是只靠最终大模型一次跑分来主张架构改进。
不能支持
不能说推理吞吐快 2.5×、API 便宜 2.5×、训练总成本少 2.5×,也不能说所有 benchmark 一致提高 2.5×。
图中没有公开拟合系数、模型尺寸、训练 token、原始数值点、置信区间和各组件的独立曲线。KDA、AttnRes、LatentMoE、Per-Head Muon、数据变化与训练稳定化同时进入新配方,因果贡献无法拆开。这个数字可以视为组合系统的内部 scaling signal,不能视为可独立复现的单组件因果效应。
预训练:公开了结构性选择,隐藏了预算性选择
数据覆盖 Web、Code、Math、Knowledge 与视觉;流程包含过滤、质量评分、去重,以及对知识和数学内容的重述。文本和视觉从训练开始就联合进入,而非先训纯文本再做后置对齐。上下文课程从 8K 扩到 64K,cooldown 再扩到 256K 与 1M;模型不使用显式位置编码,以 NoPE 支持长度外推。
优化上使用 Per-Head Muon:不把整个 Q/K/V 投影作为一个大矩阵正交化,而是按 attention head 分开处理。报告称这样更稳定、开销略低,但没有给出隔离的数字消融。训练还沿用 K2 的 weight clipping、cosine learning rate、1% warmup、0.1 weight decay,并把 QB 纳入路由。
报告没有给出总训练 token、各数据域比例、明确数据源与许可证、训练 FLOPs、集群规模、GPU days、失败 run 或碳 / 能源口径。公开权重足以复现推理和微调,却不足以复现从零预训练,也不足以独立验证 2.5× scaling efficiency。
后训练:不是让一个策略学会全部,而是先分化再合并
Multi-Teacher On-Policy Distillation 不要求学生模仿教师的离线完整答案,而是在学生自己访问到的 token 状态上,用裁剪后的 teacher / student 概率比形成逐 token 奖励。报告称只看 teacher top-k 概率没有明确收益。这样做更贴近部署分布,也降低传统 sequence distillation 的 exposure mismatch;代价是训练仍需在多个教师上计算概率,且报告没有披露教师数量之外的完整预算。
长程 RL 的关键对象是“可恢复状态”
长任务不必每次从头 rollout。训练只完成比例为 λ 的轨迹,把中间状态留到下一轮恢复;逐 token regularization 处理这些略微 stale、off-policy 的片段。Reasoning effort 本质是每题 token budget,超过预算给 -1,并分阶段退火预算阈值。Agentic GRM 则先读答案、生成 rubric、打分并写 scorepad,还给 verbosity 设置预算,以减少“写得更长就更像正确”的奖励投机。
报告搭建统一白盒 harness,把 tools、system、context、skills、memory、subagents 做成可组合模块,并实例化 Kimi Code、Claude Code、Codex、OpenClaw、Hermes 等环境。任务覆盖知识图谱驱动的数据合成、检索、kernel 优化、mock Gmail / Notion / Slack / Canvas、跨日持久任务和网页开发。这里的训练对象不只是语言模型,而是“模型 + 上下文协议 + 工具状态 + verifier”。
K3 的模型卡要求在多轮对话中保留完整 assistant message,包括 reasoning content 与 tool calls。对使用者来说,这相当于隐藏状态 ABI:如果框架只回传最终文本,模型下一轮看到的状态已不是训练时状态。harness 兼容性本身会成为能力的一部分。
系统协同:架构没有消灭复杂度,而是把复杂度重新分配
FlashKDA / KCP
KDA 序列状态可写成 transition 与 zero-state fragment,再用 prefix scan 做 context parallel。长序列不需要所有卡按 token 串行传递完整状态。
MoonEP
通过动态冗余专家和静态 shape 做接近完美的 expert load balance,并给出每 rank 最多需要约 E/R 个冗余专家的上界。
Activation Manager
联合选择重算、量化与 offload;配合 pipeline ZeRO-2、点对点 Muon,把 ViT 计算塞进 pipeline bubble。
AgentENV
Firecracker microVM 支持暂停、分叉、快照与恢复;发布方报告 checkpoint 133 ms、resume 49 ms,并以 6.5× memory overcommit 承载海量环境。
1M agentic RL 被描述为在“几百张 GPU”内协同运行,但这是后训练系统规模,不是 K3 预训练算力。推理侧用 CPU DRAM 作为外部 KV / 状态池、NVMe offload 训练状态,并根据资源预算做 admission control。KDA prefix cache 又把物理块和 hash 块解耦:可以稀疏保存 KDA checkpoint,同时复用 MLA KV 与 KDA 状态。
这揭示了线性注意力的真实交换:它减少了随历史 token 线性增长的 KV,但每个请求仍有不可忽略的递归状态,且 MoE 增加了专家通信。复杂度从“为每个 token 存 KV”迁移到“管理状态、前缀、专家和环境生命周期”。K3 的优势来自把这笔复杂度系统化,而不是让它凭空消失。
评测审计:把 45 个 benchmark 拆成 50 个子指标后,能力形状更清楚
报告表格混合了无工具 / 有工具结果、第三方公布数字、官方 rerun、不同 agent harness 与内部 benchmark。将分拆列计为独立单元,共得到 50 个可比子指标。逐项、不加权地比较 K3 与各基线,结果如下:
| 对手 | K3 胜 | 平 | 负 | 有效比较数 | 应如何读 |
|---|---|---|---|---|---|
| Fable | 16 | 1 | 29 | 46 | Fable 在 reasoning、部分 coding / vision 与高强度 agentic 项仍占优 |
| GPT-5.6 | 32 | 1 | 16 | 49 | K3 的 agentic 广度明显,基础推理并非全面领先 |
| Claude Opus 4.8 | 47 | 0 | 3 | 50 | 按此表口径 K3 广泛领先,但 harness 与 effort 并不统一 |
| GPT-5.5 | 46 | 2 | 1 | 49 | 大多数项目占优,不应外推到表外任务 |
| GLM-5.2 | 28 | 0 | 0 | 28 | 只有 28 个共同报告单元,缺失项不能算胜利 |
说明:这是用于审计“能力形状”的逐项胜负计数,不是聚合能力分。不同 benchmark 的难度、方差、样本量和实际价值不相等。
Reasoning 是最稳定的反例:K3 在 CritPt 与 HLE(有无工具)落后 Fable,在 GPQA、CritPt、HLE 上也落后 GPT-5.6。相反,DeepSWE 67.5、Program 77.8、Terminal 88.3、Frontier 81.2、BrowseComp 91.2 等结果更符合它的训练重心。
1M context 的最佳反例来自 K3 自己
BrowseComp 使用 300K 上下文并做 compaction 得 91.2;允许 1M、但不做 context management 得 90.4,低 0.8 分。差距很小,不能证明压缩普遍更优;却足以否定“上下文越大、原样塞入越好”。长程 agent 的实际能力依赖检索、摘要、前缀复用和状态管理,而不是只看模型卡的最大长度。
横向比较的实验单位不是裸模型
K3 以 max effort、temperature 1 运行;单步任务通常 top-p 0.95,agentic 项多为一次轨迹。SWE-Marathon 使用特定日期分支与 H20 校准,Fable 还有 35% fallback;WorldVQA 通过 ForceAnswer prompt 降低拒答;部分 coding 项运行 Kimi、Claude 或 Codex harness。更准确的比较单位是:
如果只把表格标题当作“模型 A 对模型 B”,会把大量系统差异错误归因给权重本身。
安全与案例:内部 showcase 和独立能力评估要分开
报告的内部 cyber 流程称约 70% 经审查候选漏洞为 genuine、发现 16 个 zero-days,并在 36 个 exploit 任务中完成 14 个,GLM-5.2 为 8 个。这些数字来自发布方环境,适合说明系统能做什么,不构成独立验证。GPU kernel、MiniTriton、nano-KPU 芯片、研究、知识工作和视频编辑案例也应按 showcase 阅读,而非统一 benchmark。
UK AISI 与美国 CAISI 的独立初步评测提供了更好的外部锚点:
- ExploitBench:K3 为 32%,GLM-5.2 为 24%,说明它在当时开放权重模型中更强。
- 任意代码执行:K3 为 0/41,而最强受测闭源模型平均 20/41,说明最高危阶段仍有显著差距。
- The Last Ones 企业网络靶场:K3 平均走到 32 步中的第 17 步,领先 GLM-5.2 的 11 步,落后领先模型的 28.5 步;10 次中完整攻破 1 次。
这组结果同时反驳两种极端叙事:K3 既不是“只会 benchmark、没有真实 agent 能力”,也不是“已经追平最强闭源模型”。它已经具备需要严肃治理的自主网络攻击能力,但在高难 exploit chain 和稳定性上仍有明显 frontier gap。
公开权重、量化与部署:可获得不等于完整可复现
公开配置与报告高度一致:93 层、7168 隐藏维、96 attention heads、69 个 KDA layer indices、24 个 full-attention layers、896 选 16、两个 shared experts、3584 latent width,以及 1M 上下文。权重采用 compressed-tensors:routed expert weights 以 MXFP4 group-32 表示,激活为 MXFP8;attention、shared experts、latent 投影、lm head、视觉与 projector 等被排除在低精度专家规则之外。
报告说,预训练 MTP layer 在后训练中变成 EAGLE-3 风格 draft model,并用七步 unroll 与 acceptance-oriented loss 训练。但主配置写着 num_nextn_predict_layers: 0,权重索引中没有匹配 MTP、nextn、EAGLE 或 draft 的 tensor,模型卡也没有草稿 checkpoint。最严谨的结论是:报告描述了这项部署组件,但它没有包含在公开主权重仓库中;不能据此断言内部组件不存在,也不能假定开源部署自动获得相同 speculative decoding 收益。
官方部署 recipe 显示,8 卡只适用于 B300 或 MI350X / MI355X 这类大显存设备;H100 80GB 方案使用 4×8,即 32 卡。报告建议 64+ accelerators 以获得更好效率,但这不是绝对最小卡数。文档同时标注部分 recipe 仍在最终验证,部署者应重新测吞吐、精度和峰值内存。
许可证:open-weight,但不是无条件宽松开源
官方自定义许可证授予查看、修改、分发和商业使用等广泛权利,但对大规模 Model-as-a-Service 和超大商业产品附加条件:特定 12 个月累计收入超过 2000 万美元的 MaaS 业务需另行取得书面协议;超过 1 亿 MAU 或月收入超过 2000 万美元的商业产品需显著展示 “Kimi K3”。内部使用和官方 / 认证伙伴有相应豁免。它适合称为开放权重,不宜直接等同 Apache-2.0 / MIT 式无限制许可证;具体商业适用性仍应由法律团队核对原文。
成本叙事:缓存命中率比标价更决定长程 Agent 经济性
2026-07-16 的官方 API 快照为:缓存命中输入 0.30 美元 / 百万 token,未命中输入 3 美元,输出 15 美元。博客称 coding 场景 cache hit 超过 90%。如果恰好按 90% 命中粗算,平均输入单价约为 0.9×0.30 + 0.1×3 = 0.57 美元 / 百万 token;但长推理的输出仍以 15 美元计价,不能只拿命中输入价代表整个任务成本。
报告的 cost frontier 图混合了内部测量成本与外部模型公开 API list price。硬件、吞吐、延迟、批处理、缓存策略和输出质量并未统一,因此它适合展示“公开价格下的位置”,不构成同一基础设施上的受控系统比较。对 coding agent 来说,真正的工程问题是让 400K 级稳定前缀可复用,把每轮 4K 左右新增内容与环境状态隔离,而不是只追求最低 nominal token price。
六个可迁移的 insight
- 下一阶段的架构竞争是信息流治理。 K3 不只增加容量,而是让 token 历史、层历史和专家集合都可被选择。比“线性注意力 vs 全注意力”更重要的问题,是哪些信息必须精确保留、哪些可以压缩、多久需要一次全局纠偏。
- 极稀疏 MoE 的瓶颈会从 FLOP 转向协调。 1/56 的专家选择率看似便宜,但 896 个专家放大了负载漂移、通信尾延迟和权重存储。QB 与 MoonEP 不是附属优化,而是让架构成立的必要条件。
- 长上下文是系统属性,不是单一长度参数。 模型能接收 1M token,不代表产品应把所有历史原样保留。K3 自身的 BrowseComp 结果已经表明 compaction、prefix cache 与状态恢复可以比“更大窗口”更关键。
- 思维链保留正在变成协议兼容问题。 多轮工具 Agent 若丢弃 reasoning state,就改变了后续策略条件分布。未来评估应把消息序列化格式、工具调用回传和 memory policy 视为模型 ABI,而不是 SDK 细节。
- 开放权重提高了结构透明度,却没有自动提高训练透明度。 1.56 TB 权重和配置能验证层数、专家、精度与推理行为;缺失的 token、数据配比、算力与 scaling 原始点决定了研究者仍无法回答“同预算能否复现”。
- 榜单的自然单位正在从模型变成完整执行栈。 当 effort、harness、工具、context policy、verifier 都改变结果时,单一 leaderboard 数字会把系统工程收益错误压缩成模型能力。真正可比较的报告需要固定或分层公布这些变量。
如果继续研究,最值得做的验证
| 问题 | 最小可信实验 | 会改变什么判断 |
|---|---|---|
| 2.5× 来自哪里 | 同数据、同 token、同激活 FLOPs,逐步加入 KDA、AttnRes、LatentMoE、Muon 与稳定化;公开拟合点、多 seed 和区间 | 从组合相关性提升为组件因果归因 |
| QB 是否优于步长 bias | 896 专家规模对照 load CV、tail latency、dead expert、loss 与通信;扫 histogram bins | 验证理论上的无步长优势能否转成端到端吞吐 |
| AttnRes 检索了什么 | 按 token 类型、任务、深度可视化 9 个 source 权重,并做 block size / fixed mixing 对照 | 判断它在保存早层信息还是只做尺度校准 |
| 原生视觉从零训练是否值得 | 等 FLOPs、等数据对照 SigLIP init 与 random init,报告梯度、收敛速度、OCR、视频和视觉推理 | 区分稳定可行与样本效率 / 最终能力优势 |
| 1M 上下文何时有用 | 固定总 token budget,比 raw 1M、检索、层级摘要、300K compaction 和 cache-aware memory | 把最大窗口转成 context policy 的条件结论 |
| 公开部署是否复现报告效率 | 发布 draft checkpoint;在 8/16/32/64 卡上统一测 prefill、decode、acceptance、功耗和精度 | 闭合报告中的 EAGLE-3 与公开服务栈之间的缺口 |
术语对齐
证据边界与资料索引
本文完成了技术报告全部 47 页(含图表、脚注与附录)的逐页核对,并交叉检查博客、模型仓库、权重索引、配置、许可证、部署说明和会改变核心判断的上游方法资料。结构、文件规模、配置和许可证条款属于可直接核验的发布物事实;训练稳定性、2.5× scaling、benchmark、成本、环境规模与案例若无独立复现,均按发布方报告处理;AISI / CAISI 结果属于外部初步评估。胜负计数、比例、权重均摊和版本差异为本文复算,不是官方聚合指标。
- Kimi K3 Technical Report — 架构、预训练、后训练、系统、评测、附录与引用;本文以 2026-07-28 更新版本为主要口径。
- Kimi K3 官方博客 — 2026-07-16 首发叙事、案例、API 价格与早期 benchmark 快照。
- MoonshotAI/Kimi-K3 — 官方报告仓库与更新历史。
- moonshotai/Kimi-K3 模型仓库 — 模型卡、公开权重、配置、模型代码与文件索引。
- Kimi K3 License — 官方自定义许可证及大规模商业使用条件。
- SGLang Kimi K3 部署文档 — 公共服务模态、硬件 recipe、精度参数与草稿模型状态。
- Kimi Linear: An Expressive, Efficient Attention Architecture — KDA、混合线性 / 全注意力与长上下文效率的上游论文。
- Attention Residuals — Full / Block AttnRes、深度信号稀释、缩放实验和系统实现。
- MoonshotAI/Attention-Residuals — AttnRes 官方仓库与结构说明。
- LatentMoE: Toward Optimal Accuracy per FLOP and Parameter in Mixture of Experts — 低维 routed experts 的原始设计与硬件—软件协同动机。
- 游走在 MoE 王国:基于最优分配促进负载均衡 — K3 报告 QB 推导明确跟随的 Jianlin Su 文章;若页面临时限制访问,可从报告引用 [112] 核对标题与日期。
- UK AISI / CAISI Preliminary Assessment of Kimi K3's Cyber Capabilities — ExploitBench、ACE 与 The Last Ones 的独立初步结果和限制。
- Kimi K2: Open Agentic Intelligence — K2 架构、训练与 agentic 基线,用于理解 K3 的扩展幅度。
总训练 token、数据混合、预训练 FLOPs / GPU days、2.5× 曲线原始点与置信区间、完整组件消融、MOPD / RL 预算、EAGLE-3 draft checkpoint、视频公共服务路径和第三方全榜复测均未公开或未完成。后续版本若补齐这些材料,应重新评估本文对可复现性与因果归因的判断。