İngilizce ve Türkçe twitter mesajlarının Word2Vec modeli ile sınıflandırılması


Tezin Türü: Yüksek Lisans

Tezin Yürütüldüğü Kurum: Atatürk Üniversitesi, Fen Bilimleri Enstitüsü, Bilgisayar Mühendisliği Anabilim Dalı, Türkiye

Tezin Onay Tarihi: 2018

Tezin Dili: Türkçe

Öğrenci: ABDULLAH AMMAR KARCIOĞLU

Danışman: Tolga Aydın

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Teknolojinin gelişmesi ve internetin tüm dünyaya yayılmasıyla birlikte insanların dünyada meydana gelen değişimlerden her an haberdar olabilmesi için ve kendi düşüncelerini herkese paylaşabilmesi için sosyal medya platformları zamanla gelişmiş durumdadır. Tüm dünyada en çok kullanılan sosyal medya platformlarından biri olan twitter günlük hayatın en önemli parçalarından biri haline gelmiştir. Twitter ile kullanıcılar kendi duygu ve düşüncelerini paylaşarak veri madenciliği alanında sosyal medyada duygu analizi çalışmalarında kullanılabilecek önemli veri kaynaklarını oluşturmaktadırlar. Python programlama dilinde gerçekleştirilen bu çalışmanın ilk aşamasında, kullanıcıların paylaşmış oldukları türkçe twitter mesajlarında metin temsili yöntemlerini kullanarak duygu analizi çalışması gerçekleştirilmiştir. Amaç, terim frekansı tabanlı Tf-Idf(Bag-of-Words) modeliyle anlamsal ilişki tabanlı Word2Vec modelinin duygu analizi çalışmalarında başarıya olan etkilerinin karşılaştırılmasıdır. 3 farklı modelin uygulandığı çalışmanın ilk aşamasında, 3. modelde Word2Vec modeline Random Forest algoritması uygulanmasıyla %66,40 ile en yüksek başarı yüzdesi elde edilmiştir. Elde edilen sonuçlar scikit-learn kütüphanesine ait makine öğrenmesi algoritmalarını kullanıp performans metrikleri kıyaslanarak türkçe doğal dil işleme çalışmalarına literatür katkı sağlanmıştır. Bu çalışmanın ikinci aşamasında ise, ingilizce ve türkçe twitter mesajlarındaki etiketli verilerin sınıflandırılmasında Word2Vec modelinin uygulanması ve mesajlar üzerinde kök alma işleminin Word2Vec modeline olan etkisi araştırılmaktadır. Çalışmamızın ikinci aşamasında, ingilizce ve türkçe olmak üzere iki farklı veri kümesi bulunmaktadır. Her bir veri setine twitter mesajlarının kökleri alınmamış hali ve kökleri alınmış hallerine öznitelik çıkarma yöntemlerinden kelime torbası (bag of words, BOW) ve Word2Vec modelleri uygulanıldı. Python programlama dilinde uygulanılan bu çalışmada, scikit-learn sınıflandırma algoritmalarından Linear SVM ve Logistic Regression uygulanarak başarı yüzdeleri kıyaslanmıştır ve duygu analizi sınıflandırmasında iyi sonuçlar ürettiği gösterilmiştir.