L'azienda Mistral AI ha presentato un grande modello linguistico chiamato Devstral, ottimizzato per affrontare le sfide nella sviluppo di software. A differenza dei modelli AI standard, Mistral AI va oltre la scrittura di singole funzioni e l'integrazione del codice, offrendo capacità che consentono di analizzare e contestualizzare (determinarne lo scopo e la logica) grandi basi di codice, identificare relazioni tra componenti e scoprire errori difficili da rilevare in funzioni complesse.
Il modello comprende 23,6 miliardi di parametri, tiene conto del contesto in 128 mila token ed è pubblicato con licenza Apache 2.0. L'archivio scaricabile con Devstral occupa 47 GB ed è idoneo per l'uso su sistemi locali: per eseguire il modello basta un PC con scheda grafica NVIDIA GeForce RTX 4090 e 32 GB di RAM. Il modello può essere utilizzato negli strumenti open-source SWE-agent e OpenHands per automatizzare la correzione degli errori, l'analisi del codice e l'apporto di modifiche.
Il sistema può essere applicato per risolvere problemi specifici (issue) su GitHub e supera notevolmente altri progetti nel set di test SWE-Bench Verified, che verifica la correttezza nella risoluzione di problemi standard nel codice (sono proposti 500 test basati su reali report di bug su GitHub). In questo test il modello Devstral ha ottenuto il 46,8%, mentre il modello Claude 3.5 Haiku ha raggiunto il 40,6%, SWE-smith-LM 32B il 40,2% e GPT-4.1-mini il 23,6%. Tra l'altro, Devstral ha superato modelli di grandi dimensioni come Deepseek-V3-0324 671B (38,8%) e Qwen3 232B-A22B (34,4%), che coprono centinaia di miliardi di parametri.
Fonte: opennet.ru
