TÜRKÇE TWEETLERİN ANALİZ EDİLEBİLMESİ İÇİN HADOOP/HIVE KULLANAN MELEZ BİR SİSTEMİN GELİŞTİRİLMESİ


Tezin Türü: Doktora

Tezin Yürütüldüğü Kurum: Atatürk Üniversitesi, Sosyal Bilimler Enstitüsü, Yönetim Bilişim Sistemleri - Anabilim Dalı, Türkiye

Tezin Onay Tarihi: 2018

Tezin Dili: Türkçe

Öğrenci: Sinan Kul

Asıl Danışman (Eş Danışmanlı Tezler İçin): Üstün ÖZEN

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Günümüzde, tüketiciler, hizmet aldıkları firmalar hakkında beğenilerini ve/veya eleştirilerini e-ticaret sitelerinde veya Facebook ve Twitter gibi sosyal medya ortamlarında paylaşmaktadırlar. Piyasa araştırması yapmak, pazarlama stratejilerini geliştirmek, müşteri memnuniyetini ve firma itibarını ölçmek isteyen firmalar için ise bu paylaşımlar oldukça değerlidir. Bu paylaşımların ayrıca, diğer müşterilerin satın alma davranışını etkilediği ve marka bağlılığını artırdığı da yapılan çalışmalarla ortaya konmuştur. Bilişim ve iletişim teknolojilerinin ucuzlaması ve yaygınlaşmasıyla sayısı giderek artan sosyal yazışmaların analiz edilmesi ise geleneksel veri analizi tekniklerinin sınırlarını aşmıştır. Bunun için gerek verilerin düşük maliyetli bir şekilde ve anlık olarak toplandığı gerekse işlendiği (doğal dil işleme) ve analiz edildiği (duygu analizi) bilgisayar tabanlı sistemlere ihtiyaç duyulmaktadır. Bu çalışma ile işletmelerin kendileriyle ve rakipleriyle ilgili paylaşılan Twitter yorumlarını takip etmelerine ve pazardaki konumlarını periyodik olarak yorumlayabilmelerine imkân sağlayan düşük maliyetli bir uygulama geliştirilmesi amaçlanmıştır. Geniş kullanıcı kitlesi ve yaygın kullanımı dolayısıyla da veri kaynağı olarak Twitter seçilmiştir. Veri kümesi içindeki tüm kelimeler özellik olarak kullanılacağı için veri boyutu çok büyük olacağından, Hadoop kümesi üzerinde Hive betiklerinin koşturulmasına karar verilmiştir. Çalışma kapsamında gerçekleştirilen sistem, özetle dört modülden oluşmaktadır: birinci modül gerekli verilerin periyodik ve otomatik olarak toplanabilmesine imkân vermekte, ikinci modül ile veriler ön işleme tabi tutulmakta; üçüncü ve dördüncü modüllerde ise analiz ve raporlama yapılabilmektedir. Sonuçlar, ilgili sektördeki tüm işletmelerin karşılaştırmalı analizleri ile görselleştirilerek raporlanabilmektedir.