[新聞] Kimi K3開放日:模型權重、技術報告和關鍵Infra技術同步開放

看板Stock (股票)作者 (單推人) 每日換婆 (1/1)時間1小時前 (2026/07/28 09:23), 編輯推噓28(32427)
留言63則, 41人參與, 13分鐘前最新討論串1/1
原文標題: Kimi K3開放日:模型權重、技術報告和關鍵Infra技術同步開放 原文連結:https://news.futunn.com/hk/post/76650176/ 發布時間: 2026/07/28 記者署名:stephen (文章來源為月之暗面) 原文內容: 今天是 Kimi K3 開放日,我們發佈 Kimi K3 的模型權重、技術報告,並開源支撐 Kimi K3 模型訓練的關鍵 Infra 技術:MoonEP、FlashKDA和AgentEnv。希望以此加速前沿智能的部 署與普及,促進 AGI 研究。 Kimi K3 是我們能力最強的模型:這是一個擁有 2.8 萬億參數的混合專家(MoE)模型,具 備原生視覺理解能力,並支持 100 萬 token 的上下文窗口。 Kimi K3 參數規模是 Kimi K2.5 的 3 倍左右,但是規模化並不僅僅是參數的堆疊,在並不 寬裕的算力條件下,我們憑藉 Kimi Delta Attention、Attention Residuals 以及 MoonEP 等一系列技術創新,規模化效率提升了 2.5 倍(即在算力最優意義下,單位算力產出智能 約等於原來 2.5 倍)。 現在,每個人都可以下載並部署 Kimi K3 模型——無論是用於內部研發,還是嵌入到面向 終端用戶的產品中,均可自由使用(其他使用情形,詳見Kimi K3 許可證)。 今天,與 Kimi K3 模型權重一起公開的,還有我們的模型訓練方法——Kimi K3 技術報告 已同步上線。 從技術報告中,你可以了解這些技術細節: KDA + AttnRes:以 3:1 比例混合 KDA 與 Gated MLA,實現高效長上下文建模,並通過塊 級注意力殘差增強跨層信息流動。 Stable LatentMoE:每個 token 從 896 個路由專家中激活 16 個,並通過 SiTU-GLU 與 Q uantile Balancing 保持極高稀疏度下的訓練穩定。 MoonViT-V2:視覺編碼器從零開始使用 next-token prediction 訓練,無需對比預訓練, 在達到 SigLIP 初始化基線效果的同時獲得更穩定的優化過程。 後訓練與評估:在通用推理、通用 Agent 和編程 Agent 三大領域進行大規模任務合成,百 萬 token 上下文的強化學習基建,近 20 個內部評測集的完整評估結果。 以上幾點只是概覽,詳細論述與消融實驗,都已在技術報告中展開。 模型能力背後,離不開訓練系統,即 Infra 基礎設施層的穩定支撐。今天,我們向大家介 紹支撐 Kimi K3 訓練的三項 Infra 技術:MoonEP、FlashKDA 和 AgentEnv,覆蓋從高性能 通信、高性能算子到分佈式 RL 環境的關鍵鏈路。其中 FlashKDA 此前已開源,MoonEP 和 AgentEnv 則隨本次發佈正式開源。 MoonEP:MoonEP 是我們爲超大的細粒度 MoE 打造的高性能通信庫,讓專家並行(expert-p arallel)的通信在不均衡的情況下仍然實現極致效率。 FlashKDA:FlashKDA 是我們實現的 Kimi Delta Attention 高性能算子(kernel)。在英 偉達 H20 上,相比 flash-linear-attention 基線,它的 prefill 速度提升 1.72-2.22 倍,可以直接作爲 flash-linear-attention 的替換後端。 AgentEnv:AgentENV 是我們與 KVCache.ai 合作開發的沙箱系統,用於大規模運行 Agent 環境。它爲 Kimi K3 的後訓練提供高保真、強隔離沙箱,靈活支持快速快照、恢復和分叉 (fork)等,可以應對大規模並行的 Agent 工作流與訓練任務。 這三項技術是支撐 Kimi K3 訓練效率與穩定性的關鍵。現在將它們開放出來,希望也能爲 你訓練下一代模型提供幫助。 我們堅信開放權重模型的價值。它們能降低獲取智能的門檻,推動創新,並賦予用戶對數據 更大的控制權、隱私保護和所有權。在過去幾周裏,我們很高興聽到了許多來自 AI 社區, 以及與我們有着共同願景的技術領袖的支持聲音。 我們相信,對於 AGI 這樣具有深遠影響的技術,一個廣泛、開放的生態系統是最適合承載 它的土壤。爲此,我們將繼續貢獻自己的力量。 心得/評論: Kimi K3今天正式開源,已經有多家服務商上線了 只要近乎Sonnet的價格就能享受部分跑分超越Fable的模型 不想花錢的也沒關係,只要有6TB記憶體你也能在家跑 記憶體又要不夠了... -- ※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 42.79.17.89 (臺灣) ※ 文章網址: https://www.ptt.cc/bbs/Stock/M.1785201800.A.D96.html

07/28 09:24, 59分鐘前 , 1F
我前天看原來已經用中國門號註冊Kimi了,舒服
07/28 09:24, 1F

07/28 09:24, 59分鐘前 , 2F
看有沒有機會帶起AIPC了~
07/28 09:24, 2F

07/28 09:26, 57分鐘前 , 3F
捲到大家沒錢賺,消費者的勝利,股民的悲劇
07/28 09:26, 3F

07/28 09:28, 55分鐘前 , 4F
下面一定有人造謠是偷Fable 5 XDDD
07/28 09:28, 4F

07/28 09:29, 54分鐘前 , 5F
所以現在是在跌KIMI 嗎?
07/28 09:29, 5F

07/28 09:30, 53分鐘前 , 6F
首先,你要有GB200或GB300機櫃
07/28 09:30, 6F

07/28 09:30, 53分鐘前 , 7F
太多人註冊使用 算力不夠 現在KIMI已經停止新戶註冊
07/28 09:30, 7F

07/28 09:30, 53分鐘前 , 8F
跑得動嗎?
07/28 09:30, 8F

07/28 09:31, 52分鐘前 , 9F
每個人都可以下載並部署???
07/28 09:31, 9F

07/28 09:31, 52分鐘前 , 10F
要有80張RTX5090顯卡才能順順的跑啊...
07/28 09:31, 10F

07/28 09:31, 52分鐘前 , 11F
老黃有利 大科技有利 LLM不利
07/28 09:31, 11F

07/28 09:33, 50分鐘前 , 12F
你也要有足夠鏟子才跑的了
07/28 09:33, 12F

07/28 09:33, 50分鐘前 , 13F
為了保障之前已經註冊過的舊會員繼續使用 除非後面
07/28 09:33, 13F

07/28 09:34, 49分鐘前 , 14F
只要用家中人人都有的GB300+6T記憶體都能跑 美國完
07/28 09:34, 14F

07/28 09:34, 49分鐘前 , 15F
蛋了
07/28 09:34, 15F

07/28 09:34, 49分鐘前 , 16F
真的會有腦洞大開的傻子相信蒸餾Fable 5嗎
07/28 09:34, 16F

07/28 09:34, 49分鐘前 , 17F
這種東西就自嗨宣傳的 實際上一般用戶根本不可能自
07/28 09:34, 17F

07/28 09:34, 49分鐘前 , 18F
己跑
07/28 09:34, 18F

07/28 09:34, 49分鐘前 , 19F
設備商笑呵呵
07/28 09:34, 19F

07/28 09:35, 48分鐘前 , 20F
添購新的硬體設備 擴充算力極限 新用戶註冊可能要等
07/28 09:35, 20F

07/28 09:35, 48分鐘前 , 21F
讚讚讚
07/28 09:35, 21F

07/28 09:35, 48分鐘前 , 22F
老黃利多
07/28 09:35, 22F

07/28 09:35, 48分鐘前 , 23F
6T記憶體XDDD
07/28 09:35, 23F

07/28 09:35, 48分鐘前 , 24F
訓練方法也開源? 這麼佛?
07/28 09:35, 24F

07/28 09:36, 47分鐘前 , 25F
支那最會的就是這個 宣傳放大優點 但但書完全不提
07/28 09:36, 25F

07/28 09:36, 47分鐘前 , 26F
或是留在備註 不仔細了解的人看到標題就被騙了
07/28 09:36, 26F

07/28 09:37, 46分鐘前 , 27F
中國人自己用就好 沒人在乎的東西
07/28 09:37, 27F

07/28 09:37, 46分鐘前 , 28F
感覺很厲害
07/28 09:37, 28F

07/28 09:37, 46分鐘前 , 29F
花個6百萬買記憶體就能跑了喔
07/28 09:37, 29F

07/28 09:37, 46分鐘前 , 30F
等看看有沒有量化模型
07/28 09:37, 30F

07/28 09:38, 45分鐘前 , 31F
樓下先用
07/28 09:38, 31F

07/28 09:39, 44分鐘前 , 32F
真的,拜託歐美不要來用Kimi,回去用貴鬆鬆的A畜或
07/28 09:39, 32F

07/28 09:39, 44分鐘前 , 33F
歐噴漿吧
07/28 09:39, 33F

07/28 09:40, 43分鐘前 , 34F
有足夠鏟子的應該都去當AI中轉站賺錢了
07/28 09:40, 34F

07/28 09:40, 43分鐘前 , 35F
GB300+6T記憶體還有一個發電廠 不會有人沒有吧
07/28 09:40, 35F

07/28 09:42, 41分鐘前 , 36F
6T?零售價看來還要繼續漲 哈哈哈
07/28 09:42, 36F

07/28 09:43, 40分鐘前 , 37F
誰有GB300+6T 都可以參加慈善AI大賽
07/28 09:43, 37F

07/28 09:45, 38分鐘前 , 38F
又有來裝懂的 這種東西本來就不是給個人跑的
07/28 09:45, 38F

07/28 09:45, 38分鐘前 , 39F
這權重開放本來就是給企業自己訓練模型的
07/28 09:45, 39F

07/28 09:46, 37分鐘前 , 40F
蒸餾啦 一定有問題 開始哭
07/28 09:46, 40F

07/28 09:46, 37分鐘前 , 41F
光是KIMI的Model商變多 御三家的Token價就拉不起來
07/28 09:46, 41F

07/28 09:47, 36分鐘前 , 42F
無論如何都是對消費者有利
07/28 09:47, 42F

07/28 09:47, 36分鐘前 , 43F
6TB就能佈建 這對企業很簡單吧
07/28 09:47, 43F

07/28 09:48, 35分鐘前 , 44F
一般用戶deepseek就夠用,企業買幾十張顯卡,幾台AI
07/28 09:48, 44F

07/28 09:48, 35分鐘前 , 45F
server自己架起來跑,有問題嗎?人家就是來讓你美
07/28 09:48, 45F

07/28 09:48, 35分鐘前 , 46F
國AI賺不了錢的
07/28 09:48, 46F

07/28 09:49, 34分鐘前 , 47F
靠北 講的好像6TB很便宜似的...
07/28 09:49, 47F

07/28 09:51, 32分鐘前 , 48F
錢不夠還有GLM Deepseek Qwen
07/28 09:51, 48F

07/28 09:51, 32分鐘前 , 49F
智譜現在股價-18%
07/28 09:51, 49F

07/28 09:53, 30分鐘前 , 50F
個人能跑的Qwen3.6 27B 35B衍生模型 也是有點生產力
07/28 09:53, 50F

07/28 09:53, 30分鐘前 , 51F
文組真的不懂裝懂 K3比GPT 5.6還貴
07/28 09:53, 51F

07/28 09:54, 29分鐘前 , 52F
好歹也上網查查 token效率 唉 算了 講了也是白講
07/28 09:54, 52F

07/28 09:58, 25分鐘前 , 53F
樓上說的是真的
07/28 09:58, 53F

07/28 09:58, 25分鐘前 , 54F
美國巨頭股價崩
07/28 09:58, 54F

07/28 10:01, 22分鐘前 , 55F
抓到 KIMI就是崩盤元凶
07/28 10:01, 55F

07/28 10:02, 21分鐘前 , 56F
晚上公布財報,看到資本支出,續崩
07/28 10:02, 56F

07/28 10:03, 20分鐘前 , 57F
一堆薩酷拉
07/28 10:03, 57F

07/28 10:05, 18分鐘前 , 58F
這根AIpc沒關聯 要用在普通電腦就是35b上下 這種就
07/28 10:05, 58F

07/28 10:05, 18分鐘前 , 59F
是server ai
07/28 10:05, 59F

07/28 10:07, 16分鐘前 , 60F
這種模型確實對大家好 幫忙壓openai anthropic價
07/28 10:07, 60F

07/28 10:07, 16分鐘前 , 61F
1t以上開源早就有
07/28 10:07, 61F

07/28 10:10, 13分鐘前 , 62F
只要有6TB記憶體 XDD
07/28 10:10, 62F

07/28 10:10, 13分鐘前 , 63F
Kimi3比GPT5.6還貴應該是誤解或過時資訊.
07/28 10:10, 63F
文章代碼(AID): #1gQ0I8sM (Stock)
文章代碼(AID): #1gQ0I8sM (Stock)