VK Tech показал, как найти простаивающие GPU в Kubernetes
VK Tech опубликовал перевод статьи о метриках GPU в Kubernetes с инструкцией, как дать командам доступ только к своим данным. Поводом стала ситуация в одной из компаний: GPU простаивал с нулевой загрузкой одиннадцать дней подряд, но никто этого не заметил, потому что метрики хранились в центральном Prometheus без доступа для тенантов.
В статье разобраны шесть PromQL-запросов для поиска неиспользуемых карт. Это актуально для компаний, где GPU — крупнейшая статья инфраструктурных расходов.
Источник: Хабр — всё
Новости этого рынка выходят у нас в телеграме первыми — @wikicompass.