2026-08-21 · ИТ и разработка

DeepSeek запустил мультимодальную модель с поддержкой 600 изображений

DeepSeek выпустил deepseek-v4-flash-vision-exp — мультимодальную модель, которая обрабатывает текст и изображения одновременно. Модель описывает картинки, читает скриншоты и анализирует графики на уровне обычного V4-Flash по текстовым задачам, но показывает значительный прирост на мультимодальных бенчмарках, приближаясь к Opus 4.8. Одно изображение стоит максимум 384 токена независимо от размера до 5000×5000 пикселей; тариф совпадает с V4-Flash — $0.14 за миллион входящих токенов, что даёт примерно 18 тысяч изображений на доллар.

В одном запросе можно отправить до 600 изображений в форматах JPEG, PNG, GIF и WebP через OpenAI Chat Completions, Responses API или Anthropic-совместимый /messages. Модель должна работать с документами и графикой, но может затрудниться с плотными текстами в изображениях.

Источник: источник

Новости этого рынка выходят у нас в телеграме первыми — @wikicompass.

Все новости