22 июля 2026 г.
Локальная модель сама признаёт ошибку: в облако уходит 15-35% запросов
Проба на 68 тысяч параметров ловит ошибки Gemma 4 E2B со средним AUROC 0.814 против 0.549 у энтропии токенов. 22 июля Cactus выложила веса на HuggingFace: каждый ответ идёт с confidence от 0 до 1 отдельным полем, а не строкой внутри текста. Если отправлять в Gemini 3.1 Flash-Lite 15-35% запросов, маленькая модель догоняет её на большинстве из 12 отложенных бенчмарков.

Почему это важно: Гибридные приложения до сих пор роутили запросы двумя способами. Либо просили модель оценить себя словами и потом парсили прозу. Либо считали энтропию токенов: в замерах Cactus это дало 0.549 AUROC, то есть почти монетка. Теперь сигнал берут из скрытого состояния одного промежуточного слоя во время декодирования: LayerNorm, low-rank проекция, attention pooling и маленький MLP. Доля запросов в облако зависит от задачи: ChartQA 15-20%, LibriSpeech 25-30%, MMBench, GigaSpeech и MMAU 30-35%, MMLU-Pro 45-55%. Самое любопытное: аудио в обучении пробы не было вообще, а на четырёх аудио-бенчах она даёт 0.79-0.88, где энтропия проваливается до 0.32-0.52. Ограничения авторы называют сами: проба работает только на одиночном декодировании и до первой тысячи с небольшим сгенерированных токенов, а переключать модель лучше на уровне задачи, а не отдельного шага. Код под MIT, использование самой Gemma остаётся по её лицензии. Сколько всё это экономит на счёте, в анонсе не посчитали: проценты роутинга есть, цен нет.
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
Что дальше: Прогнать свой поток запросов через пробу и посмотреть, какая доля реально уходит в облако: у Cactus вилка от 15% на ChartQA до 55% на MMLU-Pro. Готовые сниппеты есть для Transformers, MLX, llama.cpp и Cactus; для llama.cpp пока надо один раз вкомпилировать патчи, а Ollama, vLLM и SGLang ещё в работе.
Первоисточник