Разработчик ускорил OpenCode на двух видеокартах с 9 до 40 токенов в секунду
Разработчик webthefirst опубликовал на Хабре статью о оптимизации локального бэкенда OpenCode на базе двух RTX 3060 12 ГБ — ускорение с 9 до 40 токенов в секунду при работе с контекстом 100K без сжатия модели. В решении использованы tensor split без CUDA P2P, Q8 KV-cache, встроенный MTP и подбор параметров n-max; автор также протестировал неудачные подходы с NCCL и shared buffers.
Статья включает реальные тесты на long-context сценариях и проверку качества на задачах программирования.
Источник: Хабр — всё
- 23-летний студент вырастил ИИ-стартап до $2.5 млрд за месяцы 2026-09-25
- 23-летний студент вырастил ИИ-стартап Instinct до $2.5 млрд 2026-09-25
- 54 тысячи лотов Telegram-маркетплейсов не дали арбитражникам прибыль 2026-09-25
- 80% сотрудников повысили производительность с ИИ, но прибыль компаний не растет 2026-09-25
Новости этого рынка выходят у нас в телеграме первыми — @wikicompass.