Команды часто видят загрузку GPU, но не понимают:
- какая модель работает на конкретном ускорителе;
- сколько стоит генерация токенов;
- где простаивает железо;
- почему растёт инфраструктурный счёт.
piqc сканирует Kubernetes-кластер и автоматически находит inference-нагрузки на vLLM и Ray Serve.
Инструмент связывает между собой модели, GPU, реплики и runtime-метрики, а затем формирует отчёт о расходах и неэффективном использовании ресурсов.
Что умеет находить piqc:
- простаивающие GPU;
- модели на слишком дорогих ускорителях;
- полностью свободные GPU-узлы;
- фрагментацию ресурсов;
- зависшие в очереди поды;
- низкую эффективность вычислений;
- завышенную стоимость генерации токенов.
Для vLLM также собираются:
- latency;
- скорость prefill и генерации;
- загрузка KV-cache;
- глубина очереди;
- состояние inference-сервиса.
Быстрый запуск:
pipx install piqc
piqc scan --format table
Результаты можно получить в форматах
table, JSON, YAML или в виде стандартизированного facts bundle.Инструмент также запускается внутри кластера как Kubernetes Job - без постоянных агентов и sidecar-контейнеров.
Важная деталь: сейчас проект распространяется по Business Source License 1.1. Переход на Apache 2.0 запланирован на 2028 год.
По сути, piqc отвечает на вопрос, который обычный мониторинг часто оставляет без ответа:
какая именно модель сжигает GPU-бюджет и почему?
GitHub:
https://github.com/paralleliq/piqc

