N-gram Çıkarıcı
Bir n-gram, metindeki n adet ardışık kelimeden oluşan dizidir. Bu çıkarıcı metninizi küçük harfe çevirir, her boşluk ve noktalama işaretinden bölerek kelimelere ayırır ve seçtiğiniz uzunluktaki (1 ile 8 arası) her n-gramı sayar. Sonuç, en sık geçenden en seyrek geçene sıralanmış bir CSV sıklık tablosudur: SEO anahtar kelime yoğunluğu kontrollerini, dil modeli düzleştirmesini ve intihal tespitini besleyen tablonun ta kendisi.
N-gramlar nasıl çıkarılır
-
1
Metninizi yapıştırın
Bir makale, transkript ya da ürün metni bırakın. Makul girdiler için uzunluk sınırı yoktur.
-
2
n değerini seçin
Unigram (1), bigram (2), trigram (3) ve 8'e kadar. Her çalıştırmada tek bir uzunluk işlenir.
-
3
Çıkarın
Metin küçük harfe çevrilip kelimelere ayrılır; noktalama işaretleri ayırıcı sayılıp atılır.
-
4
Sıklık tablosunu okuyun
Her n-gram, geçiş sayısıyla birlikte en sıktan en seyreğe sıralanmış olarak görünür.
-
5
CSV'yi kopyalayın
Çıktı virgülle ayrılmıştır (N-gram,Count); doğrudan bir hesap tablosuna yapıştırabilirsiniz.
Her n-gram uzunluğu size ne söyler
| N | Ad | Kullanım durumu |
|---|---|---|
| 1 | Unigram | Anahtar kelime yoğunluğu, konu haritalama |
| 2 | Bigram | İfadeler (“search intent”, “page speed”), eşdizimler |
| 3 | Trigram | Uzun kuyruklu ifadeler, özellik tespiti |
| 4+ | Dört-gram ve üzeri | Yinelenen içerik tespiti, intihal işaretleri |
Araç metninizi nasıl bölüyor
- Her şey küçük harfe çevrilir, böylece “The” ile “the” aynı satırda birleşir.
- Kelime; harf, rakam veya kesme işaretinden oluşan kesintisiz bir dizidir. Diğer tüm karakterler (noktalama, simgeler, satır sonları) ayırıcı sayılır ve atılır.
- Cümle sınırları korunmaz. Bir cümlenin son kelimesiyle sonraki cümlenin ilk kelimesi yine de bir n-gram oluşturabilir; bu yüzden cümle sınırını aşan ikilileri temkinli okuyun. Bu sizin için önemliyse metni cümle cümle veya paragraf paragraf çözümleyin.
- Durak kelimeler korunur. Sizin adınıza hiçbir şey filtrelenmez; yalnızca anlamlı ifadeler istiyorsanız o satırları CSV’den sonradan silin.
- Kelimeler boşluk ve noktalamayla bulunur. Türkçe kelimeleri boşlukla ayırdığı için araç doğrudan çalışır. Ancak Türkçe sondan eklemeli bir dildir: “sayfa”, “sayfayı” ve “sayfanın” ayrı satırlara düşer. Kök bazlı bir analiz istiyorsanız metni önce Zemberek gibi bir gövdeleyiciden geçirin. Çince, Japonca ve Tayca ise kelimeleri boşlukla ayırmaz; boşluksuz bir cümlenin tamamı tek bir kelime olarak gelir, bu yüzden önce jieba, MeCab veya bir Tayca bölütleyiciyle kelimelere ayırmanız gerekir.
Durak kelimeler ne zaman kaldırılmalı
Durak kelimeler, İngilizcede “the”, “a”, “of”, “and”; Türkçede “ve”, “ile”, “bir”, “de” gibi çok sık geçen işlev kelimeleridir. Bunları bırakmak bigram listesini “of the” ve “bir de” gibi işe yaramaz ikililerle şişirir. Bu çıkarıcı onları korur; dolayısıyla anlamsal ifadeler istediğinizde bu satırları dışa aktardığınız dosyadan silin, üslubu, yazar atfını ya da işlev kelimelerinin sinyal taşıdığı dil modellerini incelerken de bırakın.
SEO kullanım durumu
“nginx config generator” ifadesini hedefleyen bir makale için şunları kontrol edin:
- Hedef bigram ve trigramınız ilk 20’de mi. “nginx config” 40. sıradaysa terimi muhtemelen yetersiz kullanıyorsunuz.
- Anahtar kelime tıkıştırmıyorsunuz. Terim büyük bir farkla 1. sıradaysa içerik spam gibi okunur.
- Anlamsal komşular var mı. “server block”, “proxy pass” ve “ssl certificate” gibi ilgili bigramlar, arama motorlarına konunun gerçekten kapsandığı güvencesini verir.
NLP ve akademik kullanım
- Dil modelleri, düzleştirme ve geri çekilme için n-gram sıklıklarını kullanır (Kneser-Ney, Good-Turing).
- Yazar atfı çalışmaları, aday yazarlar arasındaki trigram dağılımlarını karşılaştırır.
- Makine çevirisi değerlendirmesi (BLEU), aday çeviri ile referans çeviri arasındaki n-gram örtüşmesini puanlar.
Sık Sorulan Sorular
Bir tweet’ten (n-gramların pek anlamlı olmadığı yerden) bir kitap bölümüne kadar her şey. Bigramlarda istatistiksel güvenilirlik için 1.000+ kelime, trigramlar için 10.000+ kelime gerekir. Bunun altında sıralamalar gürültülüdür.
Burada değil. Metin sayımdan önce her zaman küçük harfe çevrilir; böylece “The” ile “the” (ya da “Apple” ile “apple”) ikiye bölünmek yerine tek satırda toplanır. Büyük/küçük harfe duyarlı bir kip yoktur: özel isimleri veya kodu ayrı tutmanız gerekiyorsa metni yapıştırmadan önce bunları işaretleyin.
Kelime ayırıcı olarak iş görürler ve asla bir n-gramın içine girmezler. Ancak sayım penceresini kesmezler: bir cümlenin son kelimesiyle sonraki cümlenin ilk kelimesi yine tek bir bigram olarak sayılır. Cümle sınırlarına kesinlikle uyulması gerekiyorsa cümleleri veya paragrafları ayrı ayrı işleyin.
Türkçe kelimeleri boşlukla ayırdığı için doğrudan çalışır; yalnızca eklerin her çekimli biçimi ayrı bir satır oluşturduğunu unutmayın (“araç”, “aracı”, “araçlar”). Kök bazlı bir sayım için metni önce Zemberek gibi bir araçla gövdelere ayırın. Çince, Japonca ve Tayca ise kelimeler arasına boşluk koymaz: boşluksuz cümlenin tamamı tek kelime olarak gelir. Önce jieba (Çince), MeCab (Japonca) veya bir Tayca bölütleyiciyle kelimeleri boşlukla ayırın, sonra sonucu buraya yapıştırın.
Araç herhangi bir liste uygulamaz; filtrelemeyi dışa aktardıktan sonra siz yaparsınız. En yaygın İngilizce durak kelime listesi, çoğu SEO aracının kullandığı 179 kelimelik NLTK setidir. Snowball, SpaCy ve scikit-learn biraz farklı listeler sunar. Türkçe için Zemberek veya NLTK’nin Türkçe durak kelime listesini kullanın.
İlgili Araçlar
Emoji Kopyala Yapıştır
Sık kullanılan emojilerden oluşan seçkiyi kategoriye göre gezin ve birini yerel olarak kopyalayın. Bu, tam Unicode kataloğu veya metin düzenleyicisi değildir.
Süslü Metin Oluşturucu
Düz metni altı Unicode stiline dönüştürün: daire içine alınmış, tam genişlik, monospace, script, fraktur ve çift çizgili; bio, açıklama ve kullanıcı adları için.
Disleksiye Uygun Metin Dönüştürücü
Yapıştırdığınız metni kısa paragraflar ve yaklaşık 72 karakterlik satırlar hâlinde yeniden düzenleyin. Sonucu istediğiniz belgeye, e-postaya veya editöre kopyalayın.
Kalp simgelerini kopyala
Özenle seçilmiş kalp simgelerini, renkli emojileri ve süslemeli dizileri kopyalayın. Yapıştırmadan önce tam Unicode kod noktalarını görün.
Alan Adı Oluşturucu
Tek bir anahtar kelimeden alan adı fikirleri üretin: altı yaygın TLD'de ön ekler, son ekler, yinelenen harfler ve sayı sonları.
Rastgele İsim Oluşturucu
Dengeli, kısa veya uluslararası isim havuzlarından tek seferde 50 rastgele isim oluşturun. Tam ad, yalnızca ad veya ad artı baş harf seçin.
Araç diğer dillerde mevcuttur
- N-Gramm-Extraktor [DE]
- N-gram-extraktor [SV]
- Ekstraktor n-gramów [PL]
- Extrator de n-gramas [PT]
- مستخرج N-gram [AR]
- Extractor de n-gramas [ES]
- Ekstraktor N-gram [ID]
- N-gram 抽出ツール [JA]
- N-그램 추출기 [KO]
- เครื่องมือแยก N-gram [TH]
- Trình trích xuất N-gram [VI]
- Extracteur de n-grammes [FR]
- N-gram-extractor [NL]
- N-gram Extractor [EN]
- Estrattore di n-grammi [IT]
- Экстрактор N-грамм [RU]
- N-gram 提取器 [ZH]