17 сентября 2026 г.
Модели из Hub проще запускать локально: GGML и llama.cpp вошли в экосистему Hugging Face
В статье Hugging Face от 22 февраля 2026 года описано присоединение GGML и llama.cpp к её экосистеме. GGML это компактная библиотека C/C++ для запуска нейросетей на CPU, ARM, Apple Silicon и CUDA. Связка ведёт от модели в Hub к формату GGUF и запуску через llama.cpp.

Каталог моделей, конвертация и движок запуска жили раздельно. GGML соединяет этот путь лёгкой C/C++ библиотекой: статический граф заранее планирует память, а квантование уменьшает объём весов и нагрузку на обмен данными.
Теперь. Hugging Face связывает Hub, формат GGUF и запуск через llama.cpp. GGUF хранит веса, токенизатор и метаданные модели, поэтому один файл переносит модель к локальному запуску.
Шпаргалка. Путь состоит из трёх действий: собрать llama.cpp, поставить `transformers`, `sentencepiece` и `safetensors`, затем конвертировать TinyLlama в GGUF и запустить файл через `llama-cli`. GGML подходит для полностью офлайн-запуска, лёгких настольных приложений и небольших устройств.
Следующий шаг этой связки — единый путь от модели в Hub до локального запуска через GGUF и llama.cpp.
Первоисточник
