GPT-6 Sol и Luna обогнали конкурентов на бенчмарке BitGN
Исследователь Поляков протестировал новые LLM-модели на датасете BitGN с задачами агентов в бизнесе. GPT-6 Sol достигла 100% точности на AI coding задачах и стала самой быстрой моделью в своём ценовом диапазоне, а GPT-6 Luna сдвинула ценовой фронтир. Kimi K3 заняла второе место по точности, но оказалась медленнее и дороже конкурентов.
Claude Opus 5.5 расположилась на 26-м месте из-за частых отказов отвечать. По сравнению с июльским бенчмарком новые модели обеспечивают лучшее качество при меньшей стоимости.
Источник: Поляков считает: AI, код и кейсы
- 8 программ для распознавания текста с фото протестировали на BotHub 2026-09-23
- Альфа-Банк проведёт митап про нейросети и разыграет 1 млн рублей 2026-09-23
- Альфа-Банк учит продактов искать проблемы клиентов вместо метрик 2026-09-23
- Alibaba запустила обучение Qwen4 с архитектурой на 125 млрд параметров 2026-09-23
Новости этого рынка выходят у нас в телеграме первыми — @wikicompass.