20 августа 2026 г.
Дообучать Ling-3.0 можно с любой стадии: inclusionAI выложила шесть base-чекпойнтов
Две модели, три стадии обучения у каждой, веса под MIT: точку старта дообучения выбираешь сам.

Обычно релиз весов даёт одну точку входа: финальный base. Ling-3.0 даёт шесть.
inclusionAI выложила две модели и по три чекпойнта на каждую. Раньше промежуточные стадии оставались внутри лаборатории, наружу ехал только финал.
Чем отличаются три стадии
Три ступени. Первый чекпойнт прошёл большой претрейн, но не мид-трейн. Второй прошёл мид-трейн, но без WSM-слияния и без затухания learning rate. Третий добрался до слияния.
WSM (Warmup-Stable-Merge) убирает явное затухание learning rate и вместо него взвешенно сливает периодические чекпойнты. Авторы метода мерили прирост против базовой WSD и получили +3,5% на MATH, +2,9% на HumanEval и +5,5% на MMLU-Pro (arXiv, 23.07.2025); главным фактором качества они называют длительность слияния, а не число чекпойнтов.
Что внутри и как запустить
Ling-3.0-tiny несёт 7,9B параметров, из них на токен работают 1,3B. Архитектура MoE с 512 routed-экспертами: на каждый токен просыпаются восемь routed и один shared.
Ling-3.0-flash крупнее: 124B параметров при 5,1B активных. Контекст растили по расписанию с 8K до 32K и дальше до 256K, последнюю ступень дотянули через YaRN.
Запуск. vLLM нужен вендорский, не апстримный: ветка ling_3_0 форка inclusionAI/vllm-ling-v3. Для SGLang вендор собрал готовые докер-образы, flash поднимается на четырёх GPU с флагами --tp 4 и --context-length 262144.
Первоисточник