./новости · 22 июля 2026 г.
новость
Gemma 4 научили признавать свои ошибки: в облако уходит 15-35% запросов, а не все
источник: @Hacker News front на X ↗·
машинная выжимка · сверена с источником
Cactus 22 июля выложил Gemma 4 E2B, которая вместе с ответом отдаёт число от 0 до 1 - уверенность в собственной правоте. Если роутить в Gemini 3.1 Flash-Lite только 15-35% запросов, локальная модель догоняет облачную на большинстве бенчмарков: ChartQA хватает 15-20%, аудио и MMBench - 25-35%, худший случай MMLU-Pro - 45-55%. Считает уверенность отдельный слой на 68k параметров: читает скрытое состояние во время декодинга и возвращает confidence структурой, а не текстом внутри ответа.
Почему это важно: Раньше гибридные приложения роутили по двум сигналам: просили модель оценить себя словами и потом парсили прозу, либо смотрели энтропию токенов. На 12 бенчмарках энтропия дала 0.549 AUROC - почти монетка, probe 0.814. На аудио разрыв шире: probe не видел при обучении ни одного аудио-примера, но выдаёт 0.79-0.88, энтропия - 0.32-0.52, местами хуже случайного угадывания. Для практика это меняет сам критерий: облако зовётся по числу с порогом, а не по эвристике на глазок. Ограничения авторы называют сами: оценивается только одиночная последовательность и первые 1024 сгенерированных токена, роутить лучше задачу целиком, а не каждый шаг, а под каждую новую модель probe надо обучать заново. О том, сколько миллисекунд датчик добавляет к каждому ответу, в анонсе не сказано.
Что дальше: Веса лежат на HuggingFace, код под MIT, поверх остаются условия лицензии Gemma; Transformers, MLX и Cactus работают сразу, для llama.cpp нужно собрать патч, Ollama, vLLM и SGLang обещают позже. Замер на своих данных: прогнать реальный поток запросов с выбранным порогом уверенности и посчитать, какая доля ушла в облако и насколько упал счёт.