Qwen запустили на GTX 1080 Ti с 125 млрд параметров
DeepSeek опубликовала руководство по запуску мультимодальной MoE-модели Qwen3.8-Flash-Next на старом игровом GPU с 11 GB памяти. Модель содержит 125 млрд параметров в основной части плюс 51 млрд параметров в embedding-таблицах, на каждый токен активируется около 6 млрд параметров.
Архитектура использует 512 экспертов MoE, из которых на токене выбираются 10 маршрутизируемых экспертов плюс shared expert, нативный контекст составляет 256K токенов. Публикация показывает, что большие модели можно запускать на потребительском оборудовании с правильной оптимизацией.
Источник: Habr AI
Что мы знаем о компании
DeepSeek
- финансовый директор
- DeepSeek
- DeepSeek упал на час, поступило 1,3 тыс жалоб 2026-09-23
- Китай проверяет DeepSeek и Moonshot после жалобы Anthropic 2026-09-23
- Инженер DeepSeek обвинил Anthropic в попытке закрепить лидерство под видом безопасности ИИ 2026-09-22
- DeepSeek напрямую или через подписку Ollama: что выгоднее харнессу 2026-09-21
Новости этого рынка выходят у нас в телеграме первыми — @wikicompass.