Игорь Зуриев протестировал LLM на реальных задачах и выбрал Claude
Руководитель проектов по ИИ Игорь Зуриев опубликовал на Karpov.Courses анализ выбора языковых моделей для бизнес-задач. Он протестировал Claude, GPT и другие LLM на работе с кодом, документами и прототипами, выявив, что опубликованные тесты помогают выбрать несколько кандидатов, но финальное решение требует собственной задачи и чётких критериев приёмки.
Зуриев отметил, что качество ответа важно не само по себе, а с учётом объёма ручной работы после модели — например, Claude 3.5 Sonnet исчерпал лимит без готового результата, а Fable 5.1 выдавал код практически без ошибок с первого раза.
Источник: Хабр — всё
Новости этого рынка выходят у нас в телеграме первыми — @wikicompass.