8 октября 2026 г.
Для проверки подделок лидер другой: Anti-fraud в MWS AI Vision Bench
Claude Opus 5.5 лидирует в антифроде, а GPT-6.1 Sol занимает первое место по пяти исходным задачам.

На 8 октября 2026 года Claude Opus 5.5 набирает 0,611 в Anti-fraud на публичной выборке MWS AI Vision Bench.
MWS AI проверяет мультимодальные модели на документах на русском. GPT-6.1 Sol лидирует по общему баллу, но уступает в проверке подделок. Для приложения, которое принимает изображения документов, чтение содержимого и поиск правок требуют разных замеров.
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
Лидеры различаются. Результаты MWS AI на публичной выборке, опубликованные 8 октября 2026 года:
| Модель | Общий балл Overall | Антифрод AF | | --- | --- | --- | | GPT-6.1 Sol | 0,822 | 0,487 | | Claude Opus 5.5 | 0,819 | 0,611 | | Gemini 3.8 Flash | — | 0,175 |
AF учитывает правильный класс изображения и объяснение ручных правок. Это составной балл, а не доля найденных подделок. Модель возвращает JSON с полями `label` и `arguments` и различает три случая:
- `original`: исходное изображение. - `edited`: документ с ручными правками. - `ai_gen`: изображение, сгенерированное ИИ.
Раньше бенчмарк оценивал только чтение и понимание документов. 23 июля 2026 года MWS AI добавила экспериментальный AF v0.1 отдельной оценкой. Overall по-прежнему усредняет пять исходных категорий.
Зимой команда уточнила формулировки и допустимые ответы в 395 из 400 заданий VQA, сохранив изображения. Поэтому старые результаты VQA и Overall нельзя напрямую сравнивать с результатами после обновления.
Запуск на своей модели. Бенчмарк устанавливается из репозитория MWS AI. Команды из README, проверенного 8 октября 2026 года:
```bash git clone https://github.com/mts-ai/MWS-Vision-Bench.git cd MWS-Vision-Bench conda create -n mwsvision python=3.10 conda activate mwsvision pip install -r requirements.txt python run_benchmark.py --model_name "gpt-4o-mini" --api_key "your-openai-key" --dataset_family antifraud ```
Датасет скачивается автоматически. Для короткого прогона к команде добавляется `--sample 100`. Итоговый AF рассчитывается по всей выборке и учитывает точность с равным весом классов и качество объяснения правок.
Публичная выборка содержит 209 документов: 100 исходных, 65 отредактированных и 44 сгенерированных ИИ. Вопросы доступны на русском, английском и китайском. Без токена данные загружаются так:
```python from datasets import load_dataset
dataset = load_dataset("MTSAIR/MWS-Antifraud-Bench", split="train") ```
Закрытая тестовая выборка содержит 221 пример и требует авторизованный `HF_TOKEN`. По данным MWS AI на 8 октября, корреляция мест в Anti-fraud и Overall составляет около 0,64 на публичной выборке и 0,53 на закрытой.
Источники: [разбор MWS AI от 8 октября 2026 года](https://habr.com/ru/companies/mts_ai/articles/1062176), [README и команды запуска](https://github.com/mts-ai/MWS-Vision-Bench), [состав датасета и расчёт AF](https://huggingface.co/datasets/MTSAIR/MWS-Antifraud-Bench).
В десятках лидеров Anti-fraud и Overall совпадают 7 моделей на публичной выборке и 6 на закрытой.
* Meta Platforms Inc. признана в РФ экстремистской организацией, её деятельность запрещена; Facebook и Instagram заблокированы. Meta AI и другие продукты компании — продукты этой организации.
Первоисточник