Datapizza Community ๐Ÿ•๐Ÿ“ˆ: post #1402 โ€” TG.ME

Nove modelli frontier messi alla prova sulla ricerca web piรน difficile mai testata ๐Ÿ”Ž

DeepWeb-Bench richiede di raccogliere prove massicce da fonti diverse e derivazioni a lungo raggio, molto piรน complesse dei benchmark esistenti.

Dentro troverete:
๐Ÿ“Œ Solo il 12-14% degli errori dipende dal retrieval, il resto da derivazione e calibrazione
๐Ÿ“Œ Modelli forti e deboli sbagliano in modi qualitativamente diversi
๐Ÿ“Œ Accordo tra modelli basso: correlazione di appena ฯ = 0,61
๐Ÿ“Œ Disaccordo per singolo caso fino a 18,8 punti percentuali
๐Ÿ“Œ Ogni risposta accompagnata da un record di provenienza delle fonti

Lo trovate qui ๐Ÿ‘‰ https://arxiv.org/abs/2605.21482
โค1
August 14, 2026 3.5K 6