2026-09-26 · NVIDIA · ИТ и разработка

NeuralDeep запустил три модели Qwen и Nemotron на русском железе

NeuralDeep запустил три модели Qwen и Nemotron на русском железе

Платформа NeuralDeep добавила в API три новые модели: Qwen3-Embedding-8B для векторизации текстов на 100+ языках, Qwen3-Reranker-8B для переранжирования результатов RAG и Nemotron-3-Diarization от NVIDIA для определения спикеров в аудио. Модели работают на серверах в России через партнёрство с Битрикс24 и доступны по схеме PAYG (оплата по кошельку).

Qwen3-Embedding поддерживает сжатие размерности через MRL и работает в формате FP8, реранкер обрабатывает контекст до 8k токенов, диаризация определяет до 8 спикеров в любом аудиоформате. Доступ к моделям ограничен временем: с 18:00 по 07:00 MSK в будни и круглосуточно в выходные.

Источник: Валера Ковальский

Что мы знаем о компании NVIDIA
инженер
Даниэль Хан
Что говорят

Классная моделька, очень быстрая. Есть только один нюанс: если реплики спикеров друг на друга накладываются, то она вообще никого не назначает на этот сегмент

Maxim ⁽²ʰ⁴ᵘ⁾ · @neuraldeep

Что интересно, она даже на CPU очень быстрая. На моём пятнадцатилетней давности четырёхъядерном Xeon RTF 0.1

Maxim ⁽²ʰ⁴ᵘ⁾ · @neuraldeep

Я у себя тоже поборол, но пришлось немного в её потроха забраться)

Maxim ⁽²ʰ⁴ᵘ⁾ · @neuraldeep

Комментарии из открытых обсуждений в телеграме, приведены дословно. Мнение авторов не редакция.

Новости этого рынка выходят у нас в телеграме первыми — @wikicompass.

Все новости