Hugging Face поднял точность кодовых моделей с 42% до 54% через multi-harness RL
Hugging Face опубликовала гайд по обучению языковых моделей через reinforcement learning сразу в четырёх форматах API агентов. Команда обучила модель LFM2.5-2.6B от Liquid AI одновременно в OpenCode, Claude Code, Codex и Gemini — вместо обучения в каждом отдельно. После этого точность выросла с 42% до 54%, а количество вызовов инструментов сократилось на 31%.
Обучение только в одном харнессе (OpenCode) поднимало его до 58%, но мультихарнесс-модель показала лучший результат во всех четырёх. Для сравнения: supervised fine-tuning на 3189 успешных траекториях Qwen3.8-27B достиг только 47,5%. Весь код, данные и семь обученных моделей открыты в Hugging Face.
Источник: Machinelearning
- CEO
- Clément Delangue
- Альтман признал, что OpenAI не решила проблему контроля ИИ 2026-10-06
- Бэкдор внедрили в Qwen2.5-7B за 50 долларов и два часа 2026-10-06
- NVIDIA Cosmos3-DROID — датасет для обучения робототехники объёмом 707 ГБ, доступный на Hugging Face и поддерживающий пот 2026-10-05
- Cantina Security выпустила открытую модель apex-flash-1 для исследования уязвимостей, доступную на Hugging Face под лице 2026-10-05
Новости этого рынка выходят у нас в телеграме первыми — @wikicompass.