2026-09-24 · ИТ и разработка

Stanford выпустил CLM-8B для выбора действий в агентах вместо генерации

Stanford выпустил CLM-8B для выбора действий в агентах вместо генерации

Исследователи Stanford Hazy Research представили CLM-8B — открытую 8-миллиардную модель, которая выбирает оптимальное действие из набора вариантов вместо последовательной генерации токенов. Модель получает состояние среды и возможные действия, затем сравнивает их векторные представления через скалярное произведение.

Обучение использует контрастивную функцию потерь InfoNCE, которая притягивает правильные пары «состояние-действие» и отталкивает неправильные. Базовая реализация построена на Qwen3-8B, код и модели опубликованы открыто.

Источник: Хабр — всё

Новости этого рынка выходят у нас в телеграме первыми — @wikicompass.

Все новости