piqc показывает, сколько денег Kubernetes-кластер теряет на… — DevOps — TG.ME

🔥 piqc показывает, сколько денег Kubernetes-кластер теряет на простаивающих GPU

Команды часто видят загрузку GPU, но не понимают:

- какая модель работает на конкретном ускорителе;
- сколько стоит генерация токенов;
- где простаивает железо;
- почему растёт инфраструктурный счёт.

piqc сканирует Kubernetes-кластер и автоматически находит inference-нагрузки на vLLM и Ray Serve.

Инструмент связывает между собой модели, GPU, реплики и runtime-метрики, а затем формирует отчёт о расходах и неэффективном использовании ресурсов.

Что умеет находить piqc:

- простаивающие GPU;
- модели на слишком дорогих ускорителях;
- полностью свободные GPU-узлы;
- фрагментацию ресурсов;
- зависшие в очереди поды;
- низкую эффективность вычислений;
- завышенную стоимость генерации токенов.

Для vLLM также собираются:

- latency;
- скорость prefill и генерации;
- загрузка KV-cache;
- глубина очереди;
- состояние inference-сервиса.

Быстрый запуск:


pipx install piqc
piqc scan --format table


Результаты можно получить в форматах table, JSON, YAML или в виде стандартизированного facts bundle.

Инструмент также запускается внутри кластера как Kubernetes Job - без постоянных агентов и sidecar-контейнеров.

Важная деталь: сейчас проект распространяется по Business Source License 1.1. Переход на Apache 2.0 запланирован на 2028 год.

По сути, piqc отвечает на вопрос, который обычный мониторинг часто оставляет без ответа:

какая именно модель сжигает GPU-бюджет и почему?

GitHub:
https://github.com/paralleliq/piqc
👍2❤1
August 5, 2026 2.8K 29