Yapay Zeka Destekli Üretilen Kodlar ile İnsan Yazımı Kodların Karşılaştırılması: Python Örneği


Creative Commons License

Eygu S., KESKİNKILIÇ M.

Bilgisayar bilimleri ve mühendisliği dergisi, cilt.19, sa.1, ss.24-37, 2026 (TRDizin)

Özet

Yapay zeka (YZ) temelli kod üretim araçlarının yükselişi, yazılım mühendisliğinde kod yazım süreçlerini dönüştürmektedir. Bu çalışma, YZ destekli “Bolt.New” aracıyla üretilen Python programlarını, insan eliyle yazılmış eşdeğer programlarla kalite, karmaşıklık ve okunabilirlik açısından sistematik olarak karşılaştırmayı amaçlamaktadır. 2019 öncesi GitHub’dan seçilen 30 adet insan yapımı program ile aynı işlevleri gerçekleştiren YZ üretimi programlar, satır sayılarına göre basit, orta ve karmaşık ulamlara ayrılarak incelenmiştir. Python’a özgü statik inceleme aracı Pylint ile ölçülen kalite puanı, hata sayısı, siklomatik karmaşıklık, stil ihlali, kod tekrar oranı ve belge puanı ölçüleri, iki küme arasında istatistiksel olarak karşılaştırılmıştır. Bulgular, YZ’nin basit görevlerde yüksek kalite ve düşük hata oranı sunduğunu, karmaşık görevlerde ise daha düşük karmaşıklık ve daha iyi belge sağladığını, ancak bağlamsal uygunlukta sınırlamalar gösterebildiğini ortaya koymaktadır. Bu çalışma, YZ destekli kod üretiminin Python’a özgü ölçünlere uyumunu ve hata azaltma potansiyelini nesnel ölçülerle değerlendirerek, yazılım geliştirme süreçlerinde otomasyon ve insan denetimi arasında denge kurulmasına yönelik rehber bir çerçeve sunmaktadır.
The rise of artificial intelligence (AI)-based code generation tools is transforming code writing processes in software engineering. This study aims to systematically compare Python programs generated by the AI-powered “Bolt.New” tool with equivalent human-written programs in terms of quality, complexity, and readability. Thirty human-written programs selected from GitHub prior to 2019, along with AI- generated programs performing the same functions, were categorized into simple, medium, and complex based on line count and analyzed. Metrics such as quality score, error count, cyclomatic complexity, style violations, code duplication rate, and documentation score, measured using the Python-specific static analysis tool Pylint, were statistically compared between the two groups. The findings reveal that AI offers high quality and low error rates in simple tasks, while in complex tasks, it provides lower complexity and better documentation but shows limitations in contextual appropriateness. This study evaluates the compliance of AI- generated code with Python-specific standards and its potential for error reduction using objective metrics, offering a guiding framework for balancing automation and human oversight in software development processes.