22 августа 2026 г.
Агент на открытой Qwen обошёл Opus 4.8 в воспроизведении статей: 73% задач по ML
Faraday обошёл Claude Opus 4.8 и GPT-5.5 на воспроизведении научных иллюстраций, но бенчмарк и судью Inherent сделала сама.

Двенадцать человек в лондонском King's Cross обучили агента, который переигрывает Claude Opus 4.8 на научных статьях.
Faraday берёт научную работу и заново получает одну из её иллюстраций. Оригинальный график агенту не показывают. На задачах по ML, близких к обучающим, он обходит Opus 4.8 в 73% случаев, на отложенных задачах AI-for-science — в 60%.
Лабораторию основали выходцы из DeepMind. Из стелса Inherent вышла 28 мая 2026 с seed-раундом на $50 млн от Index Ventures и Radical Ventures, среди участников — венчурное крыло NVIDIA.
Не замена фронтиру. Faraday не пишет код сам. Это агент на 27B поверх открытой Qwen3.6-27B, которому GPT-5.5 Codex подан инструментом-субагентом на всю реализацию.
Судит связка моделей. Replica, собственный бенчмарк Inherent, собран из 310 задач по 100 статьям 1990–2026 годов: 242 в обучении, 68 в тесте. Рубрику под каждую задачу пишет Claude Opus 4.7, ответы оценивает агент на базе Codex по трём независимым сэмплам.
Люди в замере тоже есть, и их мало. 11 участников дали 41 ранжирование: Faraday предпочли Claude в 80% случаев, Codex в 88%. Ранжировали только те прогоны, где преимущество Faraday уже отметил машинный судья.
Взять Faraday нельзя. Ни API, ни весов, ни листа ожидания. Единственный вход в статье и на сайте Inherent — письмо на faraday@inherentlaboratories.com.
Зато рецепт дообучения выписан и воспроизводим на открытой базе. Вариант GRPO с зачётом по ходам поверх Qwen3.6-27B через LoRA, контекст 128K, батч из 10 задач по 8 прогонов на шаг оптимизатора. Условия попытки тоже названы: 60 минут и одна седьмая GPU H200, интернет разрешён.
Первоисточник