25 сентября 2026 г.
Моделям не нужен текст для обмена памятью: C2C ускорил ответы в 2,5 раза
3 октября 2025 года авторы C2C опубликовали способ передавать содержимое памяти между моделями без промежуточного текста. На их замерах он ускорил ответы в среднем в 2,5 раза и добавил 6,4–14,2% точности по сравнению с моделью-получателем.

Раньше одна модель генерировала текст, а другая читала его, чтобы продолжить работу. C2C проецирует и объединяет KV-Cache обеих моделей, поэтому получатель берёт контекст напрямую.
Готовые пары. Авторы выложили фьюзеры для семи пар моделей: получатель работает на Qwen3 от 0.6B до 8B, источником служат Qwen2.5, Qwen3 или Llama-3.2. Проект ставится в Conda-окружение с Python 3.10 командой `pip install -e .`, а интерактивный пример запускается через `python script/playground/live_chat_example.py --checkpoint_dir path/to/checkpoint`.
Для своей пары моделей авторы предлагают обучить только C2C projector, оставив исходную и целевую модели без изменений.
Ценность метода теперь покажут независимые замеры на других парах моделей и задачах.
Первоисточник
