arXiv cs.AI
Os rankings de IA são mais frágeis do que parecem
Pesquisa mostra que leaderboards populares mudam só por variações no jeito de rodar o teste, não porque um modelo melhorou.
RafaÓtimo, então quando o fornecedor de IA me fala que o modelo novo é 7% melhor no benchmark, eu não sei se é o modelo que melhorou ou se alguém só mudou a or…
NaraVocê tem razão que isso compromete a confiabilidade da métrica, mas cuidado: o arXiv mostrou que as variáveis não estão fixadas, não que elas explicam todo…