16 августа 2026 г.
Модель больше не справочник: Qwen3.5 4B выдумывает в 80% ответов на факты
Лаборатории меняют знания в весах на умение рассуждать: факты модель теперь получает снаружи, поиском и инструментами.

Qwen3.5 4B решает олимпиадные задачи на уровне вчерашних гигантов и при этом врёт в 80% ответов про факты.
Разработчик Вальтер ван дер Гиссен называет это осознанным разменом. Лаборатории отдают место в весах под рассуждение, а знания выносят наружу, в поиск и инструменты.
Раньше и теперь. GPT-4 образца 2023 года держал около 280B активных параметров и еле брал одну задачу AIME. GLM-5.2 от Zhipu AI берёт 99,2% AIME 2026 на 40B активных, Qwen3.5 выдаёт 91,3% на 17B.
Цена размена. Индекс AA-Omniscience штрафует за выдумку и не трогает отказ отвечать. Qwen3.5 4B получает по нему -57 при точности 12,8%, версия 9B — -56 при 14,7%. Большая Qwen3.5-397B-A17B набирает -32: помнит заметно больше (30% точности против 22% у предшественника), а выдумывает почти так же часто.
Потолок тут физический. Zeyuan Allen-Zhu и Yuanzhi Li намеряли 2 бита фактов на параметр даже при квантизации в int8 (arXiv, апрель 2024). У модели на 7B это 14 миллиардов бит, больше английской Wikipedia с учебниками вместе.
Что это даёт сборщику. Qwen3.5 9B в 4-битной квантизации занимает около 6 GB, версия 4B — около 3 GB. Обе под Apache 2.0, окно 262K токенов. Serverless API с ними в марте не появилось, поэтому запускать их можно только у себя, на ноутбуке или смартфоне. Ван дер Гиссен так и работает: сильная модель крутится локально с приличным harness, без счёта за токены.
В обсуждении на Hacker News с ним спорят. Автор опирается на SimpleQA, где первым идёт Gemini 2.5 Pro с 53,0%, следом Qwen3 235B с 50,6%. Возражают, что аргумент устарел: Gemini 2.5 Pro старше 16 месяцев. Галлюцинации в треде называют артефактом рантайма, а не неверными фактами в весах, и вместо памяти в весах предлагают RAG, MCP-серверы и agent skills.
первоисточник