29 июля 2026 г.
Kimi K3 не свалился с неба: автор разложил модель на 6 работ-предшественников
Пост на r/ArtificialInteligence от 29 июля предлагает порядок чтения из 6 работ, через которые собирается архитектура Kimi K3. Цепочка: линейное внимание как fast weight programmers, Gated DeltaNet, Kimi Linear с механизмом KDA, LatentMoE и Stable LatentMoE, Attention Residuals. Из чисел в самом K3 названо одно: Stable LatentMoE включает 16 экспертов из 896 на токен.

Пост на r/ArtificialInteligence от 29 июля предлагает порядок чтения из 6 работ, через которые собирается архитектура Kimi K3. Цепочка: линейное внимание как fast weight programmers, Gated DeltaNet, Kimi Linear с механизмом KDA, LatentMoE и Stable LatentMoE, Attention Residuals. Из чисел в самом K3 названо одно: Stable LatentMoE включает 16 экспертов из 896 на токен.
Что дальше: Если собираешься читать техрепорт K3 - начни с Kimi Linear (KDA) и Stable LatentMoE: на них держатся и внимание, и роутинг. Отчёты Kimi читай подряд от K1.5 к K3.
Первоисточник