Разбор · Опубликовали 04.10.2026
Закрытый контур стоит качества: российские агенты против Claude и Codex на 25 настоящих задачах
Безопасник прав, что не пускает код наружу. Но у этого решения есть цена в задачах, и её можно посчитать.
Текст написан инженером, который ведёт vibecoding.ru, вместе с машиной агентов · таблицы РуБенча и условия вендоров проверены 4 октября 2026
На 11 одинаковых задачах РуБенча Claude Code и Codex довели до зачёта 25 попыток из 33, а российские SourceCraft и Koda — 21 и 17.
Лучший российский агент решал как Claude Haiku 4.5, младшая модель Anthropic. А чем надёжнее контур прячет код, тем меньше о нём известно, и цену компании приходится считать самой.
1. На одних задачах лучший российский агент решал как младшая модель Claude
Честно сравнить агентов можно только на одинаковых задачах. В РуБенче их 11: починки вышли после 17 июня 2026 года, когда модели таблицы уже не учились.
Каждый агент решал каждую задачу три раза, без права доработать сданное. Так у строки получается 33 попытки, и счёт идёт в доле зачтённых.
Лучший российский агент довёл до зачёта столько же попыток, сколько младшая модель Claude
Четыре лидера
Claude Code: Opus 4.8, Opus 5, Sonnet 5 · Codex: GPT-5.6 Luna
75,8 %
25 из 33
6,1–9,0
Codex + GPT-5.5
прошлая модель Codex
72,7 %
24 из 33
7,2
Claude Code + Haiku 4.5
младшая модель Anthropic
63,6 %
21 из 33
5,1
SourceCraft CLI
Яндекс, модель ds
63,6 %
21 из 33
9,4
Koda CLI
модель koda-pro на открытой GLM 5.2
51,5 %
17 из 33
11,5
Antigravity + Gemini 3.1 Pro
48,5 %
16 из 33
2,5
SourceCraft CLI
Яндекс, старая модель legacy
30,3 %
10 из 33
3,8
РуБенч, раунд 2, срез Fresh-11: 11 задач с починками после 17.06.2026, по три захода. В колонке «Мин» медиана минут на задачу. Синим отмечены зарубежные агенты, оранжевым российские. Строка Gemini 3.5 Flash опущена, Codex с GPT-5.6 Sol в срез не вошёл. /rubench/blog/round-02, снято 4 октября 2026.
Из четырёх задач лидер без доработки закрывает три, SourceCraft — две с половиной, Koda две. Остальное доделывает человек.
С SourceCraft разница чуть больше одной задачи из одиннадцати, это близко к шуму: одна задача стоит 9 пунктов. С Koda разница почти в три задачи, и она уже заметна.
В полной таблице раунда, где у агентов разные задачи, SourceCraft выглядит сильнее: 66,7 %, ровно как Codex с прошлой моделью GPT-5.5. Koda — 51,5 %, рядом с Claude Code и Haiku 4.5.
Оба российских агента работали в облаке вендора в РФ, то есть это российский контур, а не закрытый. Своих серверов в РуБенче нет, о них глава 5.

2. Этим цифрам можно верить: судит скрытый тест, а подсмотренные ответы вычтены
Наш сайт строят Claude Code и Codex, и вопрос «не подсуживаете ли своим» законный.
Зачёт ставит не жюри, а скрытый от агента тест автора настоящей починки. Задачи взяты из пяти живых репозиториев, ТЗ написаны по-русски заново.
Второй предохранитель — проверка записей работы. Два сканера разобрали все 437 попыток раунда: не нашёл ли агент готовую починку в сети или на диске.
У российских агентов таких случаев ноль. У Codex с GPT-5.6 они есть: после вычета лидер опускается с 82,6 до 71,0 %, а Luna с 75,4 до 65,2 %, ниже SourceCraft.
После вычета подсмотренных ответов Codex с GPT-5.6 Luna опускается ниже SourceCraft
РуБенч, раунд 2, страницы /rubench и /rubench/blog/round-02, сняты 4 октября 2026. В колонке «Задач» число задач, прошедших проверку на свежесть у этой модели. «После вычета» засчитывает подсмотренные зачёты провалами, прочерк значит, что такой счёт для строки не публиковался. Строки Gemini опущены.
Себя мы тоже ловили. С 15 июля стартовый код одной задачи уже содержал готовую починку, мы нашли это сами и исключили 16 таких попыток.
Границы у замера тоже есть. В строке от 11 до 25 задач, одна задача стоит 4–9 пунктов, поэтому разница меньше десяти пунктов считается шумом.
Что и как мы проверяли
| Факт | Что известно | Проверено |
|---|---|---|
| РуБенч, раунд 2 | 25 задач из пяти живых репозиториев на четырёх языках, это ошибки с тестом автора проекта, без фронтенда и долгих доработок. ТЗ на русском, по три захода на задачу, зачёт ставит скрытый тест автора починки. Российские агенты запускались в своих CLI, как у клиента. Раунд закрыт 18.07.2026, обновлён 27.07 и 06.09.2026, страница /rubench снята 4 октября 2026 | 2026-10-04 |
| Срез Fresh-11 | 11 задач с починками после 17.06.2026, позже даты, до которой училась любая модель таблицы. У всех строк одни и те же задачи, одна задача стоит 9 пунктов. У Koda одна попытка сорвалась на квоте вендора и считается проваленной | 2026-10-04 |
| Проверка записей работы | 437 попыток второго раунда, два независимых сканера и проверяющий судья. Подсмотренных ответов у российских агентов и Gemini 0 из 293, у Codex + GPT-5.6 Luna 8 из 69, у Codex + GPT-5.6 Sol 13 из 75. У Opus 5 после вычета 75,4 %, один случай из 60 | 2026-10-04 |
| Смена моделей у вендоров | SourceCraft CLI 0.0.99 от 19.08.2026 удалил модель legacy, ds стало другим именем модели по умолчанию, саму модель Яндекс не называет. Koda в июле держала koda-pro на GLM 5.2, с 17.09.2026 на GLM 5.3, koda-base на Qwen 3.8 Flash, по постам канала вендора | 2026-10-04 |
| GigaCode | Тариф «Бизнес» от 1 699 ₽ за пользователя в месяц, лицензии SaaS и on-premise. Агент для терминала доступен только участникам организаций. Независимых замеров агента не нашли, в MERA Code есть лишь модель GigaCode 1.4 | 2026-10-04 |
| Мировые рейтинги | DeepSWE v1.1, 113 задач, все модели в одном агенте, таблица 22.09.2026. GLM-5.3 69 %, Claude Opus 5 и GPT-6 Astra 74 %, превью Gemini 3.1 Pro 11,7 %. Artificial Analysis, рейтинг агентов для кода на 04.10.2026. OpenCode + GLM-5.3 53,6, Claude Code + Sonnet 5.5 68,4, Claude Code + Opus 5.5 66,0 | 2026-10-04 |
| Свои серверы | Koda от 2,5 млн ₽ разово или 2 490 ₽ с человека в месяц при минимуме 350 000 ₽ в месяц, без аренды видеокарт. GLM-5.3 в FP8 встаёт на один сервер 8×H200 по рецепту vLLM. У GigaChat 3.5 432 млрд параметров, веса под MIT с июля 2026. Cloud.ru берёт за Qwen3-Coder-Next 122 ₽ за 1 млн входных токенов, тариф с 02.10.2026 | 2026-10-04 |
| Спрос | Wordstat по РФ, 4 октября 2026. «gigacode» 8 625, «sourcecraft code assistant» 730, «корпоративные нейросети» 268, «ии в закрытом контуре» 76, «локальная llm для программирования» 94 | 2026-10-04 |
3. Замер российского агента стареет за месяц-два: вендоры меняют модель под тем же именем
Июльские строки SourceCraft и Koda описывают продукты, которых больше нет. Оба вендора сменили модели под прежними именами: Яндекс 19 августа, Koda 17 сентября.
За лето под теми же именами трижды сменилась модель и один раз испортилась задача
07.07
Claude Code на 5 задачах из 25 молча подменил Fable 5 на Opus 4.8. Подмену увидели только в полных записях работы агента. Вывод: модель пишется в журнал каждой попытки.
15.07
На нашей машине прогонов стартовый код одной задачи стал содержать готовую починку, и 16 попыток пяти агентов получили решённую задачу. Вывод: свою ошибку ищем сами и исправляем открыто.
19.08
Яндекс убрал из SourceCraft CLI модель legacy, а имя ds стало другим названием модели по умолчанию. Какая модель внутри, вендор не называет. Вывод: июльские 66,7 % относятся к прежней модели.
06.09
Мы опубликовали поправку, 16 испорченных попыток исключены, строки SourceCraft, Gemini и Opus 5 пересчитаны. Вывод: поправка живёт на той же странице, что и таблица.
17.09
Koda перевела koda-pro с GLM 5.2 на GLM 5.3, а koda-base — на Qwen 3.8 Flash. По замеру самой Koda новая koda-pro решает 54,3 % её задач против 46,7 % у прежней. Вывод: июльские 51,5 % сняты на модели, которой за этим именем больше нет.
Блог РуБенча, раунды 1 и 2, поправка 06.09.2026; история версий SourceCraft CLI и канал новостей Koda, проверено 4 октября 2026.
Правило для компании отсюда не зависит от вендора. В журнале каждой задачи должно стоять имя модели, которая реально работала, а не только агента.
Перемерить их честно на нашем наборе пока нельзя: новые модели вышли позже задач и могли видеть ответы при обучении. Перезамер ждёт свежего набора с починками после августа.
4. GigaCode ищут 8 625 раз в месяц, а открытых замеров его агента нет
GigaCode от Сбера ищут 8 625 раз в месяц, SourceCraft Code Assistant — 730 (Wordstat, 4 октября). На РуБенче GigaCode нет.
Агент GigaCode для терминала продают только организациям, и снаружи его не запустить. Облачный агент на GitVerse устроен иначе, его мы ещё не мерили.
Чем закрытее вариант, тем меньше у него открытых замеров
Карточки инструментов vibecoding.ru, сайты вендоров и списки стран Anthropic и OpenAI, проверено 4 октября 2026; рейтинг MERA Code — 4 октября 2026.
Компания, которая ставит GigaCode в контур, получает данные в РФ и цену в рублях. О качестве ей остаётся судить по словам вендора или своему замеру.
Отсюда первое правило: до покупки мест попросите вендора прогнать агента на ваших закрытых задачах. Или прогоните сами по пяти шагам из последней главы.
Если часть кода всё-таки можно отдать наружу, как компании из РФ подключить Claude Code, разобрано в статье про Claude Code для команды.
5. Открытая модель на своих серверах почти догнала лидеров, но свою связку придётся мерить самим
Самый закрытый вариант — свои серверы, тогда код не выходит из сети компании. Туда ставят коробку вендора, как GigaCode или Koda, или открытую модель, которую можно скачать самим.
У пяти способов держать код в РФ или у себя замер есть только у трёх
Сайты вендоров, тарифы Cloud.ru с 2 октября 2026 и карточки инструментов vibecoding.ru, проверено 4 октября 2026; Artificial Analysis, рейтинг агентов для кода на 4 октября 2026; сервер для GLM-5.3 — по рецепту vLLM, на который ссылается Zhipu.
Открытые модели для кода — это GLM, Qwen и DeepSeek, а из российских GigaChat 3.5, которую Сбер выложил в июле. Ей тоже нужен сервер с восемью видеокартами.
Локальных моделей в РуБенче нет, каждый агент работал через облако вендора. Ближе всего Koda: в июле её koda-pro стояла на открытой GLM 5.2 с дообучением и решила 51,5 % против 75,8 % у лидеров.
Свежая открытая модель отстаёт меньше. На бенчмарке DeepSWE, где все модели работают в одном агенте, GLM-5.3 решает 69 %, а Claude Opus 5 и GPT-6 Astra — по 74 %.
Свежая открытая GLM-5.3 почти догнала закрытых лидеров, прошлая GLM-5.2 отставала на 30 пунктов
GPT-6 Astra
OpenAI, закрытая
74 %
Claude Opus 5
Anthropic, закрытая
74 %
GLM-5.3
Zhipu, открытая
69 %
DeepSeek V4 Pro
DeepSeek, открытая
63 %
GLM-5.2
Zhipu, открытая; на ней Koda стояла в июле
44 %
DeepSWE v1.1 (Datacurve): 113 задач, все модели работают в одном агенте mini-swe-agent, у каждой лучшая настройка. Таблица обновлена 22 сентября 2026, снято 4 октября 2026. У открытых моделей веса выложены на Hugging Face.
Но агент вокруг модели значит не меньше. Превью Gemini 3.1 Pro закрывает 12 % задач DeepSWE в простом общем агенте и 47,2 % у нас в Antigravity от Google.
Рейтинг агентов Artificial Analysis меряет пары целиком, и там открытая пара отстаёт заметнее.
В рейтинге агентов открытая пара OpenCode с GLM-5.3 отстаёт от лидера на 15 пунктов
Claude Code + Sonnet 5.5
лидер рейтинга
68,4
Claude Code + Opus 5.5
Anthropic
66,0
Codex + GPT-6.1 Sol
OpenAI
62,9
OpenCode + GLM-5.3
открытый агент и открытая модель
53,6
Codex + DeepSeek V4 Pro
открытая модель
43,1
Artificial Analysis, Coding Agent Index v1.5 на 4 октября 2026: балл по набору DeepSWE, Terminal-Bench и SWE-Atlas. Показаны пять из 14 основных пар.
Железо для большой открытой модели — отдельные расходы. GLM-5.3 в облегчённом формате встаёт на один сервер с восемью видеокартами H200, а цена Koda их аренду не включает.
Своя модель — это не бесплатная копия Claude. Это отдельный проект: серверы с видеокартами, человек, который их ведёт, и свой замер качества.
6. Не весь код обязан жить в контуре: разделите его и замерьте на своих задачах
Выбор «весь код внутрь или весь наружу» ложный. Контур можно провести по коду, а не по компании.
Внутри остаются модули рядом с данными клиентов, платежами и ключами доступа. Сайт, внутренние панели и тесты можно отдать сильнейшему агенту, если позволяет политика.
Цену контура для своего кода можно посчитать тем же способом, что и РуБенч
Способ повторяет устройство РуБенча: задачи с тестом автора починки, ТЗ словами, три захода, модель в журнале каждой попытки.
Наша подписка на агентную разработку работает той же машиной, что строит этот сайт, на Claude Code и Codex. Если компания запрещает отдавать им любой код, подписка вам не подходит.
Если часть кода отдать можно, начните с теста для руководителя: десять вопросов, уровень команды и три шага на неделю.
7. Частые вопросы
Какой российский аналог Claude Code сильнее?+
По замеру РуБенча в июле 2026 года сильнее SourceCraft CLI от Яндекса: 66,7 % задач, вровень с Codex и GPT-5.5. У Koda 51,5 %. С тех пор оба сменили модели, а открытых замеров GigaCode мы не нашли. Все российские агенты с ценами и доступом собраны в подборке российских нейросетей для кода.
Что такое ИИ в закрытом контуре?+
Это когда код и данные не выходят из сети компании, а модель и агент работают на её серверах. С ним путают российский контур, где код уходит в облако вендора, но не покидает РФ.
Можно ли развернуть нейросеть для программирования локально?+
Да. Открытый агент вроде OpenCode подключается к модели на вашей машине через Ollama или LM Studio, и код не покидает сеть. Большой модели вроде GLM-5.3 нужен сервер с восемью видеокартами H200, а качество придётся мерить на своих задачах.
GigaCode бесплатный или нет?+
Для личных проектов есть бесплатный тариф вместе с агентным режимом, это условия на 26 сентября 2026 года. Компаниям Сбер продаёт тариф «Бизнес» от 1 699 ₽ за пользователя в месяц, облачный или для установки на свои серверы. Разбор — в карточке GigaCode.
Подойдёт ли нам подписка vibecoding.ru, если код нельзя выносить?+
Нет, если запрет касается всего кода: машина подписки пишет код в Claude Code и Codex. Если часть кода отдать можно, пройдите тест для руководителя, результат можно разобрать на звонке.
Когда РуБенч перемерит российских агентов?+
Когда соберём свежий набор задач с починками после августа 2026 года. Новые модели SourceCraft и Koda вышли позже задач нынешнего набора и могли видеть ответы. Письмо о новом раунде приходит подписчикам РуБенча.
Источники
- РуБенч, раунд 2: таблица, цены задач, поправка 06.09.2026 · vibecoding.ru (снято 4 октября 2026) — наш замер
- Раунд 2: срез Fresh-11 и проверка 437 попыток · блог РуБенча, 18.07.2026 — наш замер
- Сейфгард Claude Code подменял Fable 5 на Opus 4.8 · блог РуБенча, раунд 1 — наш замер
- Данные и записи работы РуБенча: раунды, реестр подсмотренных ответов · GitHub — открытые данные
- Koda: «Koda Pro на основе GLM 5.2» · канал вендора, 08.07.2026 — официальный канал
- Koda: «Koda Pro на основе GLM 5.3», Koda Base на Qwen 3.8 Flash · канал вендора, 17.09.2026 — официальный канал
- Koda для компаний: on-premise и подписка на свой контур · kodacode.ru (4 октября 2026) — официальный прайс
- SourceCraft CLI 0.0.99: модель legacy удалена, ds — имя модели по умолчанию · Яндекс, 19.08.2026 — официальная документация
- SourceCraft, тарифы с 1 октября 2026 · Яндекс — официальный прайс
- Запуск SourceCraft и обещание on-premise · пресс-релиз Яндекса, 26.02.2025 — пресс-релиз
- GigaCode для компаний: тариф «Бизнес» · Сбер, GitVerse (4 октября 2026) — официальный прайс
- GigaCode: лицензии SaaS и on-premise · документация GitVerse (4 октября 2026) — официальная документация
- GigaCode CLI — только для участников организации · документация GitVerse (4 октября 2026) — официальная документация
- MERA Code: лидерборд моделей для кода (4 октября 2026) — открытый бенчмарк
- DeepSWE v1.1: 113 задач, модели в одном агенте · Datacurve (таблица 22 сентября 2026) — открытый бенчмарк
- Coding Agent Index v1.5: агенты для кода · Artificial Analysis (4 октября 2026) — независимый замер
- GLM-5.2 и GLM-5.3: открытые веса · Zhipu, Hugging Face — карточка модели
- GLM-5.3: запуск в FP8 на одном сервере 8×H200 · рецепты vLLM — документация движка
- GigaChat 3.5: 432 млрд параметров, лицензия MIT · Сбер, Hugging Face — карточка модели
- Cloud.ru Evolution Foundation Models: тарифы с 2 октября 2026 и список внутренних моделей — официальный прайс
- Страны, где Anthropic продаёт Claude · anthropic.com (4 октября 2026) — официальный сайт
- Страны, где работает API OpenAI · platform.openai.com (4 октября 2026) — официальная документация
- Счётчик токенов машины vibecoding.ru: Claude Code и Codex · vibecoding.ru (4 октября 2026) — наш замер
- Wordstat: «gigacode», «ии в закрытом контуре», «локальная llm для программирования» · Яндекс (4 октября 2026) — замер спроса
Запомнить
1. Контур стоит качества. На одних задачах лучший российский агент июля решал как младшая модель Claude. Называйте эту цену числом, когда решаете про контур.
2. Имя агента — не модель. Пишите модель в журнал каждой задачи: вендоры меняют её без предупреждения.
3. У GigaCode и у модели на своих серверах нет открытых замеров на вашем коде. До покупки прогоните агента на своих задачах.
4. Своя модель — отдельный проект. Закладывайте в бюджет сервер с видеокартами и человека, который его ведёт.
5. Контур проводят по коду, а не по компании. Где его провести, подскажет тест для руководителя.