25 августа 2026 г.
Mac Studio теперь объединяются в ИИ-кластер: 4 машины ускоряют генерацию втрое
Apple сшила несколько Mac Studio в один пул памяти через Thunderbolt 5: кластер из 4 машин выдаёт 3x к скорости инференса.

Kimi K2.6 на триллион параметров работает дома, без единого запроса в облако. Apple запустила её на четырёх Mac Studio.
Локальный инференс перестал упираться в одну машину: модель, которая не влезает в память, теперь режется между узлами.
Как включить. RDMA поднимается в Settings галочкой «Enable RDMA over Thunderbolt» и перезагрузкой, либо разом на весь кластер: `mlx.distributed_config --hosts m5-ultra-0,... --output cluster.json --auto-setup --backend jaccl`. Дальше распределённый запуск идёт одной командой: `mlx.launch --hostfile "cluster.json" -- /remote/path/to/mlx_lm.chat --model "Qwen/Qwen3.6-27B" --max-tokens 2048`. Модель не помещается в одну машину: добавь флаг `--pipeline`, так Apple и показала Kimi K2.6 на четырёх узлах (сессия WWDC26 «Explore distributed inference and training with MLX», 25.08.2026). Связь между машинами держит JACCL, открытая библиотека Apple поверх RDMA, топологию mesh или ring она выбирает сама.
Раньше и теперь. Раньше локальную модель ограничивала память одного Mac. Теперь шесть портов Thunderbolt 5 на 120 Гбит/с превращают четыре корпуса в общий пул: Qwen 3.6 27B на четырёх узлах генерирует втрое быстрее, чем на одном. Обработка промптов на M5 Max идёт в 3,9 раза быстрее, чем на M4 Max, пиковая AI-производительность M5 Ultra в 4,3 раза выше M3 Ultra (замеры Apple, 25.08.2026).
M5 Max стоит от $2499, M5 Ultra от $5499. Предзаказ открыт 25 августа 2026, продажи стартуют 22 сентября. Ту самую конфигурацию на 512 ГБ, ради которой машину и берут под локальные LLM, сейчас заказать нельзя: в конфигураторе у M5 Ultra только 96 и 256 ГБ, апгрейд между ними стоит $4000, цену за 512 ГБ Apple не назвала. Потолок сегодняшнего заказа: $18 299 за 36 CPU, 80 GPU, 256 ГБ памяти и 16 ТБ SSD.
Открытый фронтир всё равно уходит вперёд железа. DeepSeek V4-Pro весит 893 ГБ, Kimi K3 держит 2,8 трлн параметров: в 512 ГБ они не влезут. В 128 ГБ реально живут Qwen3-Coder-Next (~47 ГБ в 4-bit) и gpt-oss-120b (~63 ГБ), и на системном промпте в 16K токенов первого слова ответа ждать 90 секунд (замер Forbes, 25.08.2026).
Первоисточник