Forscher von CodeRabbit analysierten 470 Pull-Requests (350 von KI erstellt, 150 manuell verfasst) in offenen Projekten auf GitHub und kamen zu dem Schluss, dass in den von KI-Assistenten generierten Änderungen 1,7-mal mehr signifikante Defekte und 1,4-mal mehr kritische Probleme vorhanden sind als im manuell geschriebenen Code. Im Durchschnitt wiesen die durch KI generierten Pull-Requests 10,83 Probleme auf, während der manuell erstellte Code nur 6,45 Probleme hatte.
Bei der Betrachtung einzelner Problemkategorien gab es im von KI generierten Code 1,75-mal mehr logische Fehler, 1,64-mal mehr Probleme mit der Qualität und Wartbarkeit des Codes, 1,56-mal mehr Sicherheitsprobleme und 1,41-mal mehr Leistungsprobleme. Zudem wird festgestellt, dass im durch KI generierten Code die Wahrscheinlichkeit einer fehlerhaften Passwortverarbeitung 1,88-mal höher, die Wahrscheinlichkeit einer unsicheren Bereitstellung des Zugriffs auf Objekte 1,91-mal höher und die Wahrscheinlichkeit von Cross-Site-Scripting (XSS) 2,74-mal höher ist, während die Wahrscheinlichkeit einer unsicheren Deserialisierung von Daten 1,82-mal höher ist. Im Gegensatz dazu gab es im von Menschen geschriebenen Code 1,76-mal mehr Rechtschreibfehler und 1,32-mal mehr testbezogene Fehler.



Einige andere Studien:
- Eine im November von Cortex durchgeführte Studie weist darauf hin, dass im Vergleich zum Vorjahr die Anzahl der von einem Entwickler erstellten Pull-Requests dank der Anwendung von KI im Durchschnitt um 20 % gestiegen ist, die Anzahl der Probleme in den Pull-Requests jedoch um 23,5 % zugenommen hat und die Ablehnungsrate bei Änderungen um etwa 30 % gestiegen ist.
- In einer Auguststudie der Universität Neapel wurde festgestellt, dass der durch KI generierte Code insgesamt einfacher und einheitlicher ist, jedoch mehr ungenutzte Konstrukte und eingebettete Debugging-Anweisungen enthält, während manuell geschriebener Code strukturell komplexer ist und mehr Probleme mit der Wartbarkeit aufweist.
- Das Juli-Experiment der METR-Gruppe zeigte, dass KI-Assistenten die Lösungsfindung nicht beschleunigen, sondern verlangsamen, obwohl die Teilnehmer subjektiv der Meinung waren, dass KI ihre Arbeit beschleunigt hat.
- In einer Studie der Monash-Universität im Januar wurde festgestellt, dass GPT-4 komplexeren Code generiert, der für die weitere Wartung Überarbeitungen erfordert, aber besser bei der Durchführung von Tests abschneidet.
Quelle: opennet.ru
