8 октября 2026 г.
Классификацию на русском можно вынести из LLM: FRIDA Decisions отвечает за 28 мс
Модель Сбера выбирает ответ из заданных вариантов без генерации текста и работает на собственном оборудовании.

В замере Сбера от 8 октября FRIDA Decisions решает один вопрос за 28 мс на RTX 5060 Ti. Три вопроса к одному тексту занимают 34 мс.
Вместо генерации текста. Когда LLM работает классификатором, разработчику нужен конкретный результат: куда направить обращение или какой ответ принять. FRIDA Decisions получает текст и описание вопроса, затем возвращает решение за один проход энкодера. Модель подходит для маршрутизации обращений, модерации и разметки данных. В RAG она ранжирует найденные фрагменты перед ответом нейросети.
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
Модель поддерживает четыре вида вопросов: - Выбор варианта из списка. - Оценка по шкале. - Ответ «да» или «нет». - Ранжирование кандидатов.
Новые метки задаются в JSON без дообучения. У модели 823 млн параметров, код и веса доступны под MIT, поэтому её можно встроить в собственный продукт.
На авторском бенчмарке razvilka из 735 примеров и 15 задач результаты получились такими:
| Модель или сервис | Результат razvilka | | --- | --- | | FRIDA Decisions | 0,893 | | TypeSafe Jev, коммерческий API | 0,897 | | Qwen3.5-35B-A3B | 0,897 |
Qwen в этом сравнении в 40 раз больше. Авторы не обнаружили статистически значимого различия результатов: парный тест Макнемара дал p=0,84.
Первый запуск. Для Python 3.10+ опубликована команда `pip install "frida-decisions[torch] @ git+https://github.com/ai-forever/FRIDA-Decisions@v0.4.0"`. Вызов `Judge.from_pretrained("ai-forever/FRIDA-Decisions")` скачивает веса и выбирает GPU либо CPU. Готовый Colab содержит установку, первый запрос и примеры всех четырёх типов вопросов. Демо на Hugging Face Spaces на 8 октября работает.
Для CPU есть вариант `[onnx]` и `OnnxJudge` без PyTorch. На Ryzen 5 7500F с шестью потоками авторы получили 0,88 с вместо 2,3 с у PyTorch fp32. Для Apple Silicon доступны `[mlx]` и `MlxJudge`.
Замеры GPU авторы проводили на тексте около 400 токенов: брали медиану 30 запросов после прогрева, без сети. PyTorch занимал 1,8 ГБ памяти плюс CUDA-контекст. Для Linux с GPU опубликован запуск сервера vLLM с `--io-processor-plugin frida_decisions`, запросы принимает `POST /pooling`. При восьми одновременных запросах RTX 5060 Ti обрабатывала около 60 запросов в секунду.
Каталог из 243 интентов в готовом Colab бесплатная T4 обрабатывает примерно за секунду, по данным Сбера. В отдельном авторском замере упаковка с кешем сократила время выбора из такого каталога с 4,65 до 0,44 с. Модель обработала 4 871 токен вместо 97 685.
По умолчанию модель обрезает входной текст `state` до 384 токенов. Параметр `state_max=512` включает весь обученный диапазон, а `usage.state_truncated` отмечает обрезку. Для длинных документов авторы рекомендуют фрагменты до 512 токенов.
Источники: [Статья Сбера, 8 октября 2026 года](https://habr.com/ru/companies/sberbank/articles/1092056), [официальный README](https://github.com/ai-forever/FRIDA-Decisions), [карточка модели](https://huggingface.co/ai-forever/FRIDA-Decisions).
FRIDA Decisions возвращает заданные решения, а написание свободного ответа остаётся задачей генеративной модели.
* Meta Platforms Inc. признана в РФ экстремистской организацией, её деятельность запрещена; Facebook и Instagram заблокированы. Meta AI и другие продукты компании — продукты этой организации.
Первоисточник