Yayın: Construction and performance analysis of locally adaptive base and ensemble learners
Yükleniyor...
Dosyalar
Tarih
Yazarlar
Danışman
item.page.editor
Editör
Bölüm / Program
Dergi Başlığı
Dergi ISSN
Cilt Başlığı
Yayıncı
DOI
Türü
Özet
Metin sınıflandırma, belgelerin otomatik organizasyonu için artan talepten ötürü hem akademik hem de ticari platformlarda önemli bir rol oynamaktadır. Destek Vektör Makineleri (SVM) gibi çekirdek temelli sınıflandırma algoritmaları metin madenciliği
görevinde son derece popüler hale gelmişlerdir. Bu durum esas olarak SVM’in çeşitli
uygulama alanları üzerindeki nispeten yüksek sınıflandırma doğruluğunun yanı sıra yüksek boyutlu ve seyrek veriyi işlemeyebilme yeteneklerinden de kaynaklanmaktadır. Son zamanlarda, metin sınıflandırmasında ontolojiler ve derlem
temelli istatistiki bilgi gibi arka plan bilgi birikiminden yararlanmaya yönelik artan bir
ilgi söz konusudur. Doğrusal çekirdek gibi standart çekirdek fonksiyonları yerine bu
arka plan bilgisinin avantajlarından faydalanan özelleştirilmiş çekirdek
fonksiyonlarını kullanarak SVM’in metin sınıflandırma alanındaki performansını
arttırmanın mümkün olduğu gösterilmiştir. Buna dayanarak, SVM için eğiticili ve yarı eğiticili
anlambilimsel düzeltme çekirdeklerinde, daha yüksek mertebeden yolların,
terimlerin sınıf temelli anlamsal değerlerinin ve sınıf temelli ağırlık değerlerinin yeteneklerini keşfetmek amacıyla çeşitli yöntemler geliştirilmiştir. Bu çalışmada Yüksek Mertebeden Anlambilimsel Çekirdek (HOSK), Özyineli Yüksek
Mertebeden Anlambilimsel Çekirdek (IHOSK) ve Yüksek Dereceden Terim Çekirdeği
(HOTK) gibi dolaylı anlambilimsel ilişkileri çıkartan ve kullanan derlem temelli çeşitli
anlambilimsel çekirdekler önerilmiştir. HOSK terimlerin belgeler arasındaki yüksek
mertebeden yolları kullanır. HOSK’ta belgelerin özellik vektörleri arasındaki basit iç
çarpım sonucunda birinci dereceden bir matris (F) elde edilir. HOSK belgeler, bu özellik
vektörleri arasında basit nokta ürünün birinci dereceden bir matris (F) elde edilir. İkinci
dereceden eş-oluşum matrisi (S), F’nin kendisi ile çarpılması sonucu oluşturulur. S,
HOSK’un giriş uzayından özellik uzayına dönüşümündeki çekirdek matrisi olarak
kullanılmaktadır. Deneysel sonuçlar HOSK’un doğrusal çekirdek üzerinde doğruluk
açısından bir iyileştirme sağladığını göstermektedir. HOSK’un daha gelişmiş bir modeli
debelgeler ve terimler arasındaki yüksek dereceli yolları yinelemeli bir şekilde kullanan
IHOSK’tur. Belgeler ve terimler arasındaki anlambilimsel ilişki; belgeler arasındaki
benzerlik matrisini terimler arasındaki benzerlik matrisini kullanarak ve terimler
arasındaki benzerlik matrisini de belgeler arasındaki benzerlik matrisini kullanarak
hesaplayan ve χ-Sim olarak adlandırılan özyineli bir teknikten uyarlanmıştır. Belge
benzerlik matrisi, SR (belgeler arası benzerlik matrisi) ve SC (terimler arası benzerlik
matrisi) kullanılarak özyineli bir şekilde üretilir. Deney sonuçları sınıflandırma
performansının doğrusal çekirdeğe kıyasla daha da arttığını göstermektedir. Bir sonraki
çalışmamızda, daha az karmaşıklıkta yüksek-mertebeli çekirdekler düşünülmüştür;
HOTK sadece terimler arasındaki yüksek-mertebeli yollara bağlıdır. HOTK’deki
anlambilimsel çekirdek dönüşümü sadece eğitim kümesindeki terimler arası yüksek mertebeli
eş-oluşumlar kullanılarak yapılır. HOTK, IHOSK’dan daha basittir ve aynı
zamanda daha az hesaplama kaynakları gerektirir.
Bu çalışmada, SVM için anlam bilimsel çekirdek inşa eden CMK olarak
adlandırılan yeni bir yaklaşım önerilmektedir. CMK’yı başlangıçtaki etiketsiz veriyi
etiketlendiren yeni bir yöntem eklentisi ile yarı-eğiticili öğrenmeye uyguladık ve bunu
ILBOM olarak adlandırdık. Önerilen yaklaşımlar bir belge içindeki BOW ile temsil
edilen terimlerin ağırlıklarını, terimlerin sınıf temelli anlamsal değerlerini kullanarak
düzeltmektedir. Bu da sınıflar üzerinde ayırt ediciliği olmayan genel amaçlı kullanılan
terimlerin önemini azaltırken, önemli ya da başka bir deyişle anlamlı terimlerin önemini
artırmaktadır. Bu yaklaşımlar, eşanlamlı terimler ya da sınıfla yakından ilgili terimler
gibi sınıfa özgü kavramların önemini arttırarak BOW’un dezavantajlarını azaltmaktadır.
Terimlerin sınıflar bağlamındaki anlamsal değerleri Gestalt teoriden Helmholtz esasına
göre hesaplanmaktadır. Deneysel sonuçlarımız CMK ve ILBOM’un doğrusal
çekirdekten daha üstün bir sınıflandırma keskinliği sağladığını göstermektedir.
Ayrıca Sınıf Ağırlıklı Çekirdek (CWK) olarak adlandırılan başka bir yaklaşım da bu
çalışmada önerilmiştir. Bu yöntem CMK’ya benzemektedir ancak; CWK özellikle
hesaplama zamanı konusunda bir gelişme sağlamaktadır. Temelde bu sınıf temelli
ağırlıklandırma her sınıf için terimleri önemlilik durumlarına göre gruplandırır. Bu
nedenle bu sınıf temelli ağırlıklandırma belgelerin gösterimini düzeltir ki, bu da terimler
arasına sınıf temelli bağımlılıklar getirerek vektör uzayı modelinin dikliğini değiştirir.
Sonuç olarak, istisnai durumlarda, hiç ortak terim içermedikleri halde eğer belirli bir
sınıf için benzer şekilde ağırlıklandırılmış iki belge benzer görülebilir.
Bu tezin temel katkısı standart çekirdeklerden çok daha iyi sınıflandırma doğruluğu
sergileyebilen çözümler geliştirilmesi olarak düşünülebilir. Önerilen yaklaşımların
ikinci katkısı bu modellerin WordNet gibi dış anlambilimsel kaynaklardan bağımsız
olmaları ve bu sebepten ötürü herhangi bir dile uygulanabilir olmalarıdır. Bizim
yöntemlerimizin diğer bir katkısı da eğiticisiz anlambilimsel benzerlik ölçümleri gibi
diğer terim temelli anlambilimsel benzerlik yöntemleri ile kolayca kombine edilebilir
bir yapıya temel oluşturmalarıdır.
Yöntemlerimizin özellikle sınıf bazlı yöntemlerimizi başka bir avantajı da, bunların
yürütüm süresi ile ilgilidir. Bizim bilgimize göre, yüksek dereceli yollar ve terimlerin
sınıf temelli değerleri SVM’in dönüşüm aşamasında ilk kez kullanılmaktadır ve metin
sınıflandırma için bir çekirdekte terimlerin anlambilimsel olarak düzeltilmesi üzerine
önemli bir bakış açısı kazandırabilir.
Tanım
Tez (Doktora) - Yıldız Teknik Üniversitesi, Fen Bilimleri Enstitüsü, 2015