Vergleich der Anzahl der Fehler im Code, der von Menschen und KI geschrieben wurde.

Forscher von CodeRabbit analysierten 470 Pull-Requests (350 von KI erstellt, 150 manuell verfasst) in offenen Projekten auf GitHub und kamen zu dem Schluss, dass in den von KI-Assistenten generierten Änderungen 1,7-mal mehr signifikante Defekte und 1,4-mal mehr kritische Probleme vorhanden sind als im manuell geschriebenen Code. Im Durchschnitt wiesen die durch KI generierten Pull-Requests 10,83 Probleme auf, während der manuell erstellte Code nur 6,45 Probleme hatte.

Bei der Betrachtung einzelner Problemkategorien gab es im von KI generierten Code 1,75-mal mehr logische Fehler, 1,64-mal mehr Probleme mit der Qualität und Wartbarkeit des Codes, 1,56-mal mehr Sicherheitsprobleme und 1,41-mal mehr Leistungsprobleme. Zudem wird festgestellt, dass im durch KI generierten Code die Wahrscheinlichkeit einer fehlerhaften Passwortverarbeitung 1,88-mal höher, die Wahrscheinlichkeit einer unsicheren Bereitstellung des Zugriffs auf Objekte 1,91-mal höher und die Wahrscheinlichkeit von Cross-Site-Scripting (XSS) 2,74-mal höher ist, während die Wahrscheinlichkeit einer unsicheren Deserialisierung von Daten 1,82-mal höher ist. Im Gegensatz dazu gab es im von Menschen geschriebenen Code 1,76-mal mehr Rechtschreibfehler und 1,32-mal mehr testbezogene Fehler.

Vergleich der Anzahl der Fehler im Code, der von Menschen und KI geschrieben wurde.
Vergleich der Anzahl der Fehler im Code, der von Menschen und KI geschrieben wurde.
Vergleich der Anzahl der Fehler im Code, der von Menschen und KI geschrieben wurde.

Einige andere Studien:

  • Eine im November von Cortex durchgeführte Studie weist darauf hin, dass im Vergleich zum Vorjahr die Anzahl der von einem Entwickler erstellten Pull-Requests dank der Anwendung von KI im Durchschnitt um 20 % gestiegen ist, die Anzahl der Probleme in den Pull-Requests jedoch um 23,5 % zugenommen hat und die Ablehnungsrate bei Änderungen um etwa 30 % gestiegen ist.
  • In einer Auguststudie der Universität Neapel wurde festgestellt, dass der durch KI generierte Code insgesamt einfacher und einheitlicher ist, jedoch mehr ungenutzte Konstrukte und eingebettete Debugging-Anweisungen enthält, während manuell geschriebener Code strukturell komplexer ist und mehr Probleme mit der Wartbarkeit aufweist.
  • Das Juli-Experiment der METR-Gruppe zeigte, dass KI-Assistenten die Lösungsfindung nicht beschleunigen, sondern verlangsamen, obwohl die Teilnehmer subjektiv der Meinung waren, dass KI ihre Arbeit beschleunigt hat.
  • In einer Studie der Monash-Universität im Januar wurde festgestellt, dass GPT-4 komplexeren Code generiert, der für die weitere Wartung Überarbeitungen erfordert, aber besser bei der Durchführung von Tests abschneidet.

Quelle: opennet.ru

60GB SSD 8Gb DDR4