Nove modelli frontier messi alla prova sulla ricerca web piรน difficile mai testata ๐
DeepWeb-Bench richiede di raccogliere prove massicce da fonti diverse e derivazioni a lungo raggio, molto piรน complesse dei benchmark esistenti.
Dentro troverete:
๐ Solo il 12-14% degli errori dipende dal retrieval, il resto da derivazione e calibrazione
๐ Modelli forti e deboli sbagliano in modi qualitativamente diversi
๐ Accordo tra modelli basso: correlazione di appena ฯ = 0,61
๐ Disaccordo per singolo caso fino a 18,8 punti percentuali
๐ Ogni risposta accompagnata da un record di provenienza delle fonti
Lo trovate qui ๐ https://arxiv.org/abs/2605.21482

1August 14, 2026 3.5K 6