Un agente AI puo' davvero comportarsi come un ricercatore, dall'idea alla pubblicazione? ๐ฌ
Questa suite di benchmark valuta LLM frontier e harness agentici su tutto il ciclo di vita della ricerca scientifica, non solo su un singolo task isolato.
Dentro troverete:
๐ Copertura: ideazione, letteratura, esperimenti, scrittura del paper
๐ Target: modelli frontier e harness agentici a confronto diretto
๐ Metodo: task pensati per simulare il lavoro reale di un ricercatore
๐ Risultato: gap ancora ampio tra agenti e ricercatori umani sul ciclo completo
Lo trovate qui ๐ https://arxiv.org/abs/2606.07462

2
1
1August 24, 2026 2.7K 13