Veri madenciliğinde çeşitli kümeleme algoritmalarının farklı platformlarda karşılaştırmalı analizi


Tezin Türü: Yüksek Lisans

Tezin Yürütüldüğü Kurum: Atatürk Üniversitesi, Fen Bilimleri Enstitüsü, Bilgisayar Mühendisliği Anabilim Dalı, Türkiye

Tezin Onay Tarihi: 2014

Tezin Dili: Türkçe

Öğrenci: SUHA GÖKALP

Danışman: Tolga Aydın

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Veri üretme, veri toplama ve veri kullanımındaki teknolojik gelişmeler sonucu hızlı bir şekilde artan veritabanı boyutları, verileri kısa süre içinde kullanışlı ve anlaşılır bilgilere çevirebilen yeni teknikler ve araçlar gerektirmektedir. Bu gereksinimlere yanıt vermek üzere tanımlanan veri madenciliği, mevcut veri kaynaklarından, kullanıcının farklı sorularına yanıt verecek, kesin, faydalı, anlaşılır, önceden bilinmeyen ve kullanışlı bilgilerin elde edilmesi işlemidir. Veri madenciliğinde yaygın olarak kullanılan yöntemlerden biri kümeleme analizidir. Kümeleme işlemi veri analizi aşamasında örüntü oluşturma aşamasında, veri kaynağındaki tüm verileri kullanmak yerine, benzer özellik gösteren verileri temsil eden kümeleri kullanır. Veri madenciliğinde bir çok kümeleme metodu bulunmaktadır. Bu çalışmada öncelikle veri madenciliği kavramı açıklanarak veri madenciliğinin aşamaları ve kullanım alanları hakkında bilgiler verilmiş ve daha sonra veri madenciliğinde kullanılan kümeleme algoritmaları teorik ve uygulama çerçevelerinde açıklanmaya çalışılmıştır. XLSTAT, R, WEKA ve RapidMiner (YALE) platformları çeşitli kümeleme algoritmalarını çalıştırmak için kullanılmıştır. Literatürde kullanılan kümeleme işlemine uygun bazı veri kümeleri ve bir üniversitenin kütüphane kayıtlarından elde edilen veriler ele alınarak, kümeleme analizi teknikleri uygulanmış ve sonuçlar analiz edilmiştir.