Anthropic протестировала ИИ-агентов на торговле книгами — они торговались как люди
Anthropic провела эксперимент с 201 сотрудником, который принёс по книге и описал свои вкусы ИИ-агенту. Агенты торговались на цифровом рынке, обмениваясь книгами между собой: давили на дедлайны, расхваливали товар, вели списки ожидания и даже выступали брокерами. Модель Opus достигла эффективности 0,88 по обменам против 0,75 у Haiku — инструкции о жёсткости переговоров влияли слабее, чем выбор модели.
Главная проблема оказалась не в переговорах, а в понимании предпочтений: агенты правильно угадывали выбор между двумя книгами только в 61% случаев. Участники оценили полученные книги в среднем на 7,2 из 10.
Источник: Битубитех от Яндекса
Новости этого рынка выходят у нас в телеграме первыми — @wikicompass.