2026-09-06 · ИТ и разработка

Perplexity оптимизировала embedding-модели на GPU для поиска

Perplexity оптимизировала embedding-модели на GPU для поиска

Perplexity опубликовала техническое описание инфраструктуры pplx-embed — системы, которая обрабатывает векторные представления текста для поиска и ранжирования. Команда инженеров решила не строить отдельный движок для embedding, а переиспользовала ядра из своего LLM-стека: prefill-ядра для массовой индексации и decode-ядра для запросов в реальном времени.

Оптимизация включила управление CUDA-графами, асинхронное отслеживание результатов и путь обработки запросов на Rust. Решение позволяет балансировать между пропускной способностью при переиндексации и скоростью ответа на поисковые запросы.

Источник: источник

Новости этого рынка выходят у нас в телеграме первыми — @wikicompass.

Все новости