N-gram Çıkarıcı

Bir n-gram, metindeki n adet ardışık kelimeden oluşan dizidir. Bu çıkarıcı metninizi küçük harfe çevirir, her boşluk ve noktalama işaretinden bölerek kelimelere ayırır ve seçtiğiniz uzunluktaki (1 ile 8 arası) her n-gramı sayar. Sonuç, en sık geçenden en seyrek geçene sıralanmış bir CSV sıklık tablosudur: SEO anahtar kelime yoğunluğu kontrollerini, dil modeli düzleştirmesini ve intihal tespitini besleyen tablonun ta kendisi.

N-gramlar nasıl çıkarılır

  1. 1

    Metninizi yapıştırın

    Bir makale, transkript ya da ürün metni bırakın. Makul girdiler için uzunluk sınırı yoktur.

  2. 2

    n değerini seçin

    Unigram (1), bigram (2), trigram (3) ve 8'e kadar. Her çalıştırmada tek bir uzunluk işlenir.

  3. 3

    Çıkarın

    Metin küçük harfe çevrilip kelimelere ayrılır; noktalama işaretleri ayırıcı sayılıp atılır.

  4. 4

    Sıklık tablosunu okuyun

    Her n-gram, geçiş sayısıyla birlikte en sıktan en seyreğe sıralanmış olarak görünür.

  5. 5

    CSV'yi kopyalayın

    Çıktı virgülle ayrılmıştır (N-gram,Count); doğrudan bir hesap tablosuna yapıştırabilirsiniz.

Her n-gram uzunluğu size ne söyler

N Ad Kullanım durumu
1 Unigram Anahtar kelime yoğunluğu, konu haritalama
2 Bigram İfadeler (“search intent”, “page speed”), eşdizimler
3 Trigram Uzun kuyruklu ifadeler, özellik tespiti
4+ Dört-gram ve üzeri Yinelenen içerik tespiti, intihal işaretleri

Araç metninizi nasıl bölüyor

  • Her şey küçük harfe çevrilir, böylece “The” ile “the” aynı satırda birleşir.
  • Kelime; harf, rakam veya kesme işaretinden oluşan kesintisiz bir dizidir. Diğer tüm karakterler (noktalama, simgeler, satır sonları) ayırıcı sayılır ve atılır.
  • Cümle sınırları korunmaz. Bir cümlenin son kelimesiyle sonraki cümlenin ilk kelimesi yine de bir n-gram oluşturabilir; bu yüzden cümle sınırını aşan ikilileri temkinli okuyun. Bu sizin için önemliyse metni cümle cümle veya paragraf paragraf çözümleyin.
  • Durak kelimeler korunur. Sizin adınıza hiçbir şey filtrelenmez; yalnızca anlamlı ifadeler istiyorsanız o satırları CSV’den sonradan silin.
  • Kelimeler boşluk ve noktalamayla bulunur. Türkçe kelimeleri boşlukla ayırdığı için araç doğrudan çalışır. Ancak Türkçe sondan eklemeli bir dildir: “sayfa”, “sayfayı” ve “sayfanın” ayrı satırlara düşer. Kök bazlı bir analiz istiyorsanız metni önce Zemberek gibi bir gövdeleyiciden geçirin. Çince, Japonca ve Tayca ise kelimeleri boşlukla ayırmaz; boşluksuz bir cümlenin tamamı tek bir kelime olarak gelir, bu yüzden önce jieba, MeCab veya bir Tayca bölütleyiciyle kelimelere ayırmanız gerekir.

Durak kelimeler ne zaman kaldırılmalı

Durak kelimeler, İngilizcede “the”, “a”, “of”, “and”; Türkçede “ve”, “ile”, “bir”, “de” gibi çok sık geçen işlev kelimeleridir. Bunları bırakmak bigram listesini “of the” ve “bir de” gibi işe yaramaz ikililerle şişirir. Bu çıkarıcı onları korur; dolayısıyla anlamsal ifadeler istediğinizde bu satırları dışa aktardığınız dosyadan silin, üslubu, yazar atfını ya da işlev kelimelerinin sinyal taşıdığı dil modellerini incelerken de bırakın.

SEO kullanım durumu

“nginx config generator” ifadesini hedefleyen bir makale için şunları kontrol edin:

  • Hedef bigram ve trigramınız ilk 20’de mi. “nginx config” 40. sıradaysa terimi muhtemelen yetersiz kullanıyorsunuz.
  • Anahtar kelime tıkıştırmıyorsunuz. Terim büyük bir farkla 1. sıradaysa içerik spam gibi okunur.
  • Anlamsal komşular var mı. “server block”, “proxy pass” ve “ssl certificate” gibi ilgili bigramlar, arama motorlarına konunun gerçekten kapsandığı güvencesini verir.

NLP ve akademik kullanım

  • Dil modelleri, düzleştirme ve geri çekilme için n-gram sıklıklarını kullanır (Kneser-Ney, Good-Turing).
  • Yazar atfı çalışmaları, aday yazarlar arasındaki trigram dağılımlarını karşılaştırır.
  • Makine çevirisi değerlendirmesi (BLEU), aday çeviri ile referans çeviri arasındaki n-gram örtüşmesini puanlar.

Sık Sorulan Sorular

Bir tweet’ten (n-gramların pek anlamlı olmadığı yerden) bir kitap bölümüne kadar her şey. Bigramlarda istatistiksel güvenilirlik için 1.000+ kelime, trigramlar için 10.000+ kelime gerekir. Bunun altında sıralamalar gürültülüdür.

Burada değil. Metin sayımdan önce her zaman küçük harfe çevrilir; böylece “The” ile “the” (ya da “Apple” ile “apple”) ikiye bölünmek yerine tek satırda toplanır. Büyük/küçük harfe duyarlı bir kip yoktur: özel isimleri veya kodu ayrı tutmanız gerekiyorsa metni yapıştırmadan önce bunları işaretleyin.

Kelime ayırıcı olarak iş görürler ve asla bir n-gramın içine girmezler. Ancak sayım penceresini kesmezler: bir cümlenin son kelimesiyle sonraki cümlenin ilk kelimesi yine tek bir bigram olarak sayılır. Cümle sınırlarına kesinlikle uyulması gerekiyorsa cümleleri veya paragrafları ayrı ayrı işleyin.

Türkçe kelimeleri boşlukla ayırdığı için doğrudan çalışır; yalnızca eklerin her çekimli biçimi ayrı bir satır oluşturduğunu unutmayın (“araç”, “aracı”, “araçlar”). Kök bazlı bir sayım için metni önce Zemberek gibi bir araçla gövdelere ayırın. Çince, Japonca ve Tayca ise kelimeler arasına boşluk koymaz: boşluksuz cümlenin tamamı tek kelime olarak gelir. Önce jieba (Çince), MeCab (Japonca) veya bir Tayca bölütleyiciyle kelimeleri boşlukla ayırın, sonra sonucu buraya yapıştırın.

Araç herhangi bir liste uygulamaz; filtrelemeyi dışa aktardıktan sonra siz yaparsınız. En yaygın İngilizce durak kelime listesi, çoğu SEO aracının kullandığı 179 kelimelik NLTK setidir. Snowball, SpaCy ve scikit-learn biraz farklı listeler sunar. Türkçe için Zemberek veya NLTK’nin Türkçe durak kelime listesini kullanın.

İlgili Araçlar

Araç diğer dillerde mevcuttur