Ağırlıklandırılmış Çizgelerde Tf-Idf ve Eigen Ayrışımı Kullanarak Metin Sınıflandırma

dc.contributor.authorHark, Cengiz
dc.contributor.authorKarcı, Ali
dc.contributor.authorUçkan, Taner
dc.contributor.authorSeyyarer, Ebubekir
dc.date.accessioned2021-12-29T10:02:13Z
dc.date.available2021-12-29T10:02:13Z
dc.date.issued2019
dc.departmentİnönü Üniversitesien_US
dc.description.abstractÖz: Günümüzde gerek metin gerekse cümle sınıflandırma problemleri üzerinde yoğunlukla çalışılmaktadır. Metinsınıflandırma işlemlerinde en önemli problemlerden biri sınıflandırılacak metinlerin yapısal olmamasıdır. Belli birformata sahip olmayan metinlerin öncelikle bir önişlemden geçirilmesi gerekmektedir. Bu çalışmada metinlerisınıflandırma işleminde öncelikle sınıflandırılacak metinlerin önişlemini yapmak amacıyla KUSH (Karci-UçkanSeyyarer-Hark) adında bir önişleme aracı geliştirildi. Sonrasında elde edilen işlenmiş metinlerinsınıflandırılmasında çizge tabanlı matematiksel bir yaklaşım sunulmaktadır. Yapılan çalışmada Türkiye’de iyibilinen 6 haber portalından ve 6 farklı alandan elde edilen metinleri içeren TTC-3600 veri seti kullanılmaktadır.Sınıflandırılacak metinler Tf (Terim frekansı) ve Idf (Ters doküman Frekansı) değerleri dikkate alınarak çeşitliönişlemlerden geçirildikten sonra kenar ve düğümlerden oluşan bir ağırlıklı çizge oluşturulmaktadır.Ağırlıklandırılmış çizgeler kullanılarak sınıflandırma işleminin etkililiği ve matematiksel verimliliği arttırılmıştır.Elde edilen çizgeyi ifade eden Komşuluk Matrisi ve Derece Matrisi kullanılarak Laplace Matrisi elde edilmektedir.Laplace Matrisinin özdeğer ayrışımı sonucunda elde edilen özdeğer ve özdeğer vektörleri ile metinlersınıflandırılmaktadır. Yapılan testler sonucunda sınıflandırma oranlarında dikkate değer bir doğruluk değerineulaşıldığı görülmektedir.en_US
dc.description.abstractÖz: Today, both text and sentence classification problems are studied intensively. One of the most important problems in the text classification process is that the texts to be classified are not structural. Texts that do not have a specific format must first be pre-processed. In this study, a preliminary processing tool called KUSH (Karci-UçkanSeyyarer-Hark) was developed in order to pre-process the texts to be classified first. Afterwards, a graph based mathematical approach is presented in the classification of processed texts. Studies in six including well-known news portals and obtained the text from 6 different areas in Turkey TTC-3600 data sets are used. Texts to be classified are subjected to various pre-treatments taking into consideration the Tf (Term frequency) and Idf (Reverse document frequency) values, and then a weighted graph consisting of edges and nodes is formed. By using weighted charts, the efficiency and mathematical efficiency of the grading process were increased. By using the matrix of the neighborhood matrix and the degree matrix, the Laplace matrix is obtained. The eigenvalue and eigenvalue vectors and texts derived from the eigenvalue decomposition of the Laplace matrix are classified. As a result of the tests performed, it is seen that a significant accuracy value is reached in the classification rates.en_US
dc.identifier.citationHARK C,UÇKAN T,SEYYARER E,KARCI A (2019). Ağırlıklandırılmış Çizgelerde Tf-Idf ve Eigen Ayrışımı Kullanarak Metin Sınıflandırma. Bitlis Eren Üniversitesi Fen Bilimleri Dergisi, 8(4), 1349 - 1362.en_US
dc.identifier.endpage1362en_US
dc.identifier.issn2147-3129
dc.identifier.issn2147-3188
dc.identifier.issue4en_US
dc.identifier.startpage1349en_US
dc.identifier.trdizinid381605en_US
dc.identifier.urihttps://hdl.handle.net/11616/44662
dc.identifier.urihttps://search.trdizin.gov.tr/yayin/detay/381605
dc.identifier.volume8en_US
dc.indekslendigikaynakTR-Dizinen_US
dc.language.isotren_US
dc.relation.ispartofBitlis Eren Üniversitesi Fen Bilimleri Dergisien_US
dc.relation.publicationcategoryMakale - Ulusal Hakemli Dergi - Kurum Öğretim Elemanıen_US
dc.rightsinfo:eu-repo/semantics/openAccessen_US
dc.titleAğırlıklandırılmış Çizgelerde Tf-Idf ve Eigen Ayrışımı Kullanarak Metin Sınıflandırmaen_US
dc.typeArticleen_US

Dosyalar

Orijinal paket
Listeleniyor 1 - 1 / 1
Yükleniyor...
Küçük Resim
İsim:
1e075e83-35e6-44e9-a842-9ae3eacc9978.pdf
Boyut:
352.34 KB
Biçim:
Adobe Portable Document Format
Açıklama:
Lisans paketi
Listeleniyor 1 - 1 / 1
Küçük Resim Yok
İsim:
license.txt
Boyut:
1.71 KB
Biçim:
Item-specific license agreed upon to submission
Açıklama: