Il settore dell'intelligenza artificiale sta vivendo una trasformazione significativa. Non è più sufficiente annunciare modelli sempre più potenti; è diventato essenziale dimostrare, con credibilità, l'efficacia di questi sistemi in contesti applicativi reali. In questo scenario si posiziona Vals, una startup fondata nel 2024 e sostenuta da Andreessen Horowitz, che mira a stabilire un nuovo standard per i benchmark AI attraverso test privati e verticali, concepiti per misurare i modelli su compiti professionali reali. La questione è cruciale: mentre molti test accademici sono pubblici e spesso orientati a misurare capacità astratte, i modelli di intelligenza artificiale più avanzati trovano ormai impiego in processi professionali ad alto impatto.

L'evoluzione dei benchmark e le sfide attuali

Il cofondatore Rayan Krishnan evidenzia come i benchmark accademici tradizionali non riescano più a tenere il passo con la rapida evoluzione dei modelli di intelligenza artificiale. La problematica non si limita alla sola qualità dei test, ma include anche la loro accessibilità: un set di valutazione pubblico permette ai laboratori di ottimizzare i modelli specificamente per superare quelle prove, senza che questo garantisca necessariamente prestazioni affidabili in scenari reali.

Vals si distingue proponendo test non pubblici e focalizzati su compiti specifici. L'approccio mira a spostare l'attenzione dai quiz generici alla misurazione delle prestazioni in ambiti lavorativi concreti, quali diritto, finanza, coding, cybersecurity, salute mentale, biosecurity e persino applicazioni connesse al diritto dei conflitti armati.

In questa ottica, i benchmark AI si configurano come uno strumento essenziale di verifica operativa, superando il ruolo di semplice metrica per comunicati stampa.

Un modello di valutazione indipendente e mirato

Il modello di business di Vals, sebbene distintivo, si allinea perfettamente con le esigenze emergenti del settore. Le aziende clienti corrispondono un compenso per sottoporre i propri modelli a valutazioni indipendenti, ottenendo in cambio un'analisi dettagliata su punti deboli, rischi potenziali e aree di miglioramento. L'obiettivo non è semplicemente evitare un esito negativo, ma acquisire una misurazione oggettiva e utile per perfezionare il sistema.

Un aspetto fondamentale che differenzia l'approccio di Vals è la valutazione non solo del successo di un modello, ma anche dei suoi potenziali esiti indesiderati.

Questo è un passaggio cruciale, poiché l'implementazione dell'intelligenza artificiale in settori sensibili impone la conoscenza approfondita non solo delle capacità di un modello, ma anche dei suoi limiti, delle aree in cui può fallire, generare danni o produrre risultati imprevedibili e non controllabili.

Finanziamento da 40 milioni di dollari e fiducia degli investitori

L'operazione finanziaria che ha coinvolto Vals AI ha visto la startup raccogliere 40 milioni di dollari in un round di Serie A, guidato da Andreessen Horowitz, con una valutazione stimata a 400 milioni di dollari. A questo round hanno preso parte anche investitori già presenti come 8VC, Pear VC e Bloomberg Beta, affiancati da nuovi partecipanti tra cui HRT Ventures e Next Ladder.

Questo significativo investimento evidenzia come la misurazione dei modelli,