Porównanie liczby błędów w kodzie napisanym przez ludzi i AI

Badacze z firmy CodeRabbit przeanalizowali 470 pull requestów (350 – utworzonych przez AI, 150 – napisanych ręcznie) w otwartych projektach na GitHubie i doszli do wniosku, że w zmianach generowanych przez asystentów AI występuje 1.7 razy więcej istotnych defektów i 1.4 razy więcej krytycznych problemów niż w kodzie napisanym ręcznie. Średnio w generowanych przez AI pull requestach znajdowało się 10.83 problemów, podczas gdy w utworzonych ręcznie zmianach wartość ta wynosiła 6.45.

Analizując poszczególne kategorie problemów, w kodzie utworzonym przez AI było 1.75 razy więcej błędów logicznych, 1.64 razy więcej problemów z jakością i serwisowaniem kodu, 1.56 razy więcej problemów z bezpieczeństwem oraz 1.41 razy więcej problemów z wydajnością. Dodatkowo zauważono, że w generowanym przez AI kodzie prawdopodobieństwo nieprawidłowego przetwarzania haseł jest 1.88 razy wyższe, 1.91 razy – niebezpiecznego udostępniania dostępu do obiektów, 2.74 razy – ataków typu Cross-Site Scripting (XSS) oraz 1.82 razy – niebezpiecznego deserializowania danych. W tym samym czasie w kodzie napisanym przez ludzi występuje 1.76 razy więcej błędów ortograficznych oraz 1.32 razy więcej błędów związanych z testowaniem.

Porównanie liczby błędów w kodzie napisanym przez ludzi i AI
Porównanie liczby błędów w kodzie napisanym przez ludzi i AI
Porównanie liczby błędów w kodzie napisanym przez ludzi i AI

Kilka innych badań:

  • W badaniu przeprowadzonym w listopadzie przez firmę Cortex zwrócono uwagę, że w porównaniu do ubiegłego roku, dzięki zastosowaniu AI, liczba pull requestów tworzonych przez jednego programistę wzrosła średnio o 20%, ale liczba problemów w pull requestach wzrosła o 23.5%, a wskaźnik odrzuceń zmian wzrósł o około 30%.
  • W sierpniowym badaniu Uniwersytetu Neapolitańskiego stwierdzono, że generowany przez AI kod jest w ogóle prostszy i bardziej jednolity, ale zawiera więcej nieużywanych konstrukcji oraz wbudowanych elementów debugujących, podczas gdy kod ręcznie napisany jest strukturalnie bardziej złożony i zawiera więcej problemów z serwisowaniem.
  • Lipcowy eksperyment grupy METR pokazał, że asystenci AI nie przyspieszają, a wręcz spowalniają rozwiązywanie postawionych zadań, mimo że uczestnicy subiektywnie uważali, że AI przyspieszyło ich pracę.
  • W styczniowym badaniu Uniwersytetu Monash wskazano, że GPT-4 generuje bardziej złożony kod, wymagający dopracowania do dalszego serwisowania, ale lepiej radzi sobie z przechodzeniem testów.

Źródło: opennet.ru

Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS 🔥 Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS | ProHoster