La corsa all’intelligenza artificiale locale raggiunge una nuova tappa con il lancio di Bonsai 2 27B, il modello innovativo sviluppato da PrismML. La startup, nata dai ricercatori del Caltech e guidata da Babak Hassibi, mira a rendere i modelli linguistici di ragionamento sufficientemente compatti da funzionare su PC e, in prospettiva, su smartphone di fascia alta. L'obiettivo è ridurre drasticamente le dimensioni senza compromettere le capacità operative.
L'innovazione nella compressione dei modelli LLM
Bonsai 2 27B comprime il modello Qwen3.8 27B, un noto LLM open source, a soli 5,9 GB.
Questa riduzione di memoria è di circa 9-10 volte rispetto all'originale, permettendo il deployment su dispositivi locali con risorse limitate. PrismML dichiara che il modello mantiene circa il 98% delle prestazioni aggregate del modello di partenza, un miglioramento rispetto al 95% della generazione precedente, Bonsai.
La tecnica chiave è quella dei pesi ternary. I valori che rappresentano l'apprendimento della rete neurale vengono semplificati in tre stati: +1, -1 o 0. Questa rappresentazione riduce drasticamente la memoria necessaria, con la scommessa che l'intelligenza utile possa sopravvivere alla riduzione numerica.
Prestazioni, licenza e ambiti di applicazione
Bonsai 2 27B è un modello multimodale da 27,8 miliardi di parametri, progettato per ragionamento, coding, visione e applicazioni di AI agentica.
Ha ottenuto un punteggio aggregato di 83,9 su una suite di 20 benchmark, pari al 98,2% della performance di Qwen3.8 27B (85,4). Il modello raggiunge fino a 143 token al secondo su NVIDIA GeForce RTX 5090.
Disponibile gratuitamente con licenza Apache 2.0 dal 17 settembre 2026, questa soluzione è strategica. Favorisce sviluppatori e accelera l'adozione in contesti dove privacy, latenza e costi dell'inferenza cloud sono variabili decisive. PrismML prevede utilizzi per assistenti locali, workflow privati di conoscenza, applicazioni di computer-use e attività agentiche di lunga durata.
Vantaggi dell'AI locale: privacy, costi ed efficienza energetica
L'interesse per l'AI locale è guidato da fattori come la privacy, la riduzione dei costi e l'efficienza energetica.
Eseguire l'AI sui dispositivi degli utenti protegge i dati sensibili e riduce i costi operativi legati all'infrastruttura cloud. L'obiettivo di PrismML è applicare questa compressione a modelli ancora più grandi, nell'ordine di centinaia di miliardi di parametri, per permettere a modelli avanzati di operare localmente, democratizzando l'accesso a capacità computazionali finora riservate a grandi infrastrutture.