I ricercatori di CodeRabbit hanno analizzato 470 pull request (350 create da AI, 150 scritte a mano) in progetti open source su GitHub e hanno concluso che le modifiche generate dagli assistenti AI presentano 1,7 volte più difetti significativi e 1,4 volte più problemi critici rispetto al codice scritto a mano. In media, le pull request generate tramite AI contenevano 10,83 problemi, mentre le modifiche create a mano presentavano un valore di 6,45.
Esaminando le categorie di problemi, il codice creato da AI ha mostrato 1,75 volte più errori logici, 1,64 volte più problemi di qualità e manutenibilità del codice, 1,56 volte più problemi di sicurezza e 1,41 volte più problemi di prestazioni. Inoltre, è stato notato che nel codice generato da AI c'era 1,88 volte maggiore probabilità di gestione errata delle password, 1,91 volte di fornitura non sicura di accesso a oggetti, 2,74 volte di cross-site scripting (XSS) e 1,82 volte di deserializzazione non sicura dei dati. Nel codice scritto da persone, però, c'erano 1,76 volte più errori di ortografia e 1,32 volte più errori legati ai test.



Alcuni altri studi:
- In uno studio condotto a novembre da Cortex, si nota che rispetto allo scorso anno, grazie all'uso dell'AI, il numero di pull request create da un singolo sviluppatore è aumentato in media del 20%, ma il numero di problemi nelle pull request è aumentato del 23,5%, mentre il tasso di rifiuto delle modifiche è aumentato di circa il 30%.
- Nello studio di agosto dell'Università di Napoli si conclude che il codice generato da AI è in generale più semplice e uniforme, ma contiene più costrutti inutilizzati e inserimenti di debug incorporati, mentre il codice scritto a mano è strutturalmente più complesso e presenta più problemi di manutenibilità.
- L'esperimento di luglio del gruppo METR ha mostrato che gli assistenti AI non accelerano, ma rallentano il completamento delle attività, anche se i partecipanti ritenevano soggettivamente che l'AI avesse accelerato il loro lavoro.
- Nello studio di gennaio dell'Università di Monash si indica che GPT-4 genera codice più complesso, che richiede modifiche per una futura manutenzione, ma è migliore nel superamento dei test.
Fonte: opennet.ru
