./новости · 23 июля 2026 г.
новость
Обучать код-модели теперь можно на общем датасете: The Stack v3 отдаёт 5 трлн токенов
источник: news.smol.ai·
машинная выжимка · сверена с источником
The Stack v3 вышел 23 июля: 5 трлн токенов кода после дедупликации, крупнейший открытый датасет кода. Под ними 224 млн репозиториев и 114 ТБ сырых данных. Тем же днём Black Forest Labs показала FLUX 3 - одну модель на картинку, видео, звук и предсказание действий, а Alibaba выпустила Qwen-Audio-3.0-TTS на 16 языков, первое место в TTS-рейтинге Artificial Analysis.
Почему это важно: Раньше команда, которой нужна своя код-модель, собирала обучающий корпус сама: скачать репозитории, отфильтровать, выкинуть дубли. Теперь эта работа сделана один раз и лежит открыто, а 224 млн репозиториев дают охват, который в одиночку не собрать. Второй сюжет дня - спор про дистилляцию: часть индустрии зовёт вкладываться в открытые веса вместо перегонки чужих моделей, и The Stack v3 работает аргументом этой стороны. Отдельно датасет называют базой для кибербезопасности: на таком объёме кода учат искать уязвимости. О лицензиях и правилах исключения кода из выборки в анонсе молчат.
Что дальше: Дождаться первых моделей, обученных на v3, и прогнать их на своём наборе задач против той код-модели, что стоит у тебя сейчас. 5 трлн токенов - размер корпуса, а не доказанное качество на твоём стеке.
первоисточник