Datapizza Community 🍕📈: post #1404 — TG.ME

Valutare un agente AI su un benchmark intero costa caro! 💰

Ma serve davvero farlo? 🤔

Questo paper mostra come selezionare solo i task a difficoltà intermedia permetta di ridurre drasticamente il costo di valutazione senza perdere affidabilità.

Dentro troverete:
📌 Filtro basato su tassi di successo storici tra il 30% e il 70%
📌 Riduzione dei task di valutazione dal 44% al 70%
📌 Alta fedeltà nel ranking anche cambiando scaffold nel tempo
📌 Metodo motivato dalla Item Response Theory
📌 Codice e dati rilasciati pubblicamente su GitHub

Lo potete trovare qui 👉 https://arxiv.org/abs/2603.23749
August 18, 2026 2.9K 1 9