Onderzoekers van het bedrijf CodeRabbit hebben 470 pull-requests geanalyseerd (350 - door AI gemaakt, 150 - handmatig geschreven) in open projecten op GitHub en kwamen tot de conclusie dat er in de wijzigingen die door AI-assistenten zijn gegenereerd 1,7 keer meer significante defecten en 1,4 keer meer kritieke problemen aanwezig zijn dan in handmatig geschreven code. Gemiddeld bevatten de door AI gegenereerde pull-requests 10,83 problemen, terwijl het aantal in handmatig gemaakte wijzigingen 6,45 bedroeg.
Bij het bekijken van afzonderlijke probleemcategorieƫn waren er in de door AI gemaakte code 1,75 keer meer logische fouten, 1,64 keer meer kwaliteits- en onderhoudsproblemen, 1,56 keer meer beveiligingsproblemen en 1,41 keer meer prestatieproblemen. Daarnaast werd opgemerkt dat er in de door AI gemaakte code 1,88 keer meer kans is op onjuiste verwerking van wachtwoorden, 1,91 keer op onveilige toegang tot objecten, 2,74 keer op cross-site scripting (XSS) en 1,82 keer op onveilige deserialisatie van gegevens. Daarentegen zaten er in de door mensen geschreven code 1,76 keer meer spelfouten en 1,32 keer meer fouten gerelateerd aan testen.



Enkele andere studies:
- In een studie uitgevoerd in november door Cortex wordt opgemerkt dat in vergelijking met vorig jaar, dankzij het gebruik van AI, het aantal pull-requests dat door ƩƩn ontwikkelaar wordt gemaakt gemiddeld met 20% is toegenomen, maar het aantal problemen in de pull-requests is met 23,5% gestegen en het aantal afwijzingen van wijzigingen is met ongeveer 30% toegenomen.
- In het augustusonderzoek van de Universiteit van Napels werd geconcludeerd dat de door AI gegenereerde code over het algemeen eenvoudiger en eenduidiger is, maar meer ongebruikte constructies en ingebouwde debug-inserties bevat, terwijl handmatig geschreven code structureel complexer is en meer onderhoudsproblemen bevat.
- Het experiment van de METR-groep in juli toonde aan dat AI-assistenten niet de tijdswinst brengen die werd verwacht, maar de oplossing van taken vertragen, terwijl deelnemers subjectief de indruk hadden dat AI hun werk versnelde.
- In het onderzoek van de Monash Universiteit in januari wordt aangegeven dat GPT-4 complexere code genereert die verdere aanpassing vereist voor toekomstig onderhoud, maar het beter doet bij het doorlopen van tests.
Bron: opennet.ru
