22 сентября 2026 г.
Длинные промпты Qwen3.5-4B обрабатывает быстрее: graft8 дал 3,7 раза
22 сентября вариант graft8 обработал промпт на 128 тысяч токенов в 3,7 раза быстрее исходного Qwen3.5-4B, но с потерей точности. Автор выложил две graft-версии модели.

22 сентября вариант graft8 обработал промпт на 128 тысяч токенов в 3,7 раза быстрее исходного Qwen3.5-4B, но с потерей точности. Автор выложил две graft-версии модели.
Вторая версия, graft16, ускорила обработку промпта в 2 раза с минимальной потерей точности.
Первоисточник
