21 сентября 2026 г.
Снять ограничения с открытой модели теперь дело получаса: Heretic делает это на одной RTX 3090
Скрипт сам находит и вырезает у модели рефлекс отказа, а результат остаётся ближе к оригиналу, чем ручные версии.

Оригинальная gemma-3-12b отказывала на 97 запросах из 100. Та же модель после Heretic — на трёх.
Heretic вырезает из весов открытой модели рефлекс отказа. Такую правку и раньше делали руками, но параметры подбирали на глаз, и модель уезжала от оригинала. Через Heretic сообщество уже выложило больше 5000 моделей.
Потери стало видно. Инструмент меряет, насколько правленая модель разошлась с исходной по поведению: чем меньше число, тем ближе. У лучшей ручной версии gemma-3-12b это 0,45, у версии Heretic — 0,16 при том же числе отказов (замер автора, README проекта, 22.09.2026).
Ставится двумя командами. Сначала `pip install -U heretic-llm`, дальше `heretic` и адрес любого репозитория с Hugging Face. Прогон Qwen3-4B с дефолтным конфигом занимает 20–30 минут на одной RTX 3090. Потом инструмент сам спрашивает, что делать с результатом: сохранить локально, залить на Hugging Face, открыть чат или прогнать бенчмарки.
Порог по железу автор снижал релизами. Первая публичная версия появилась 16.11.2025, через месяц 1.1.0 добавила Apple Silicon, несколько видеокарт разом и работу в Colab и Kaggle. Версия 1.2.0 от 14.02.2026 принесла 4-битную квантизацию, 1.3.0 от 05.05.2026 срезала пиковый расход видеопамяти. Актуальная 1.4.0 вышла 14.06.2026 и просит Python 3.10+.
Гибриды вроде Qwen3.5 инструмент уже берёт, state-space-архитектуры пока нет.
Первоисточник
