Bulanık Liste Eşleştirici

Bir CRM dışa aktarımını fatura müşterilerinin bulunduğu bir elektronik tabloyla karşılaştırmak ya da iki farklı ERP sistemindeki tedarikçi adlarını eşleştirmek, neredeyse her zaman küçük farklılıklar yüzünden aksar, örneğin “Acme Corp.” ile “ACME Corporation” veya “acme corp.” arasında. Her iki listeyi yapıştırın, bir benzerlik eşiği belirleyin; araç, A listesindeki her giriş için B listesindeki en uygun adayı önerir ve eşiğin altındaki girişleri elle inceleme için işaretler.

İki dağınık listeden nasıl eşleşme yapılır?

  1. 1

    Liste A'yı yapıştırın

    Her satırda bir giriş, müşteri adları, ürün kodları ve sokak adresleri.

  2. 2

    Liste B'yi yapıştırın

    Aday havuzu. Büyük/küçük harf, boşluk ve yazım hatası farklılıkları sorun değildir.

  3. 3

    Bir eşik değer belirleyin

    Uyumlu kabul edilmesi için gereken benzerlik oranı (%70 makul bir varsayımdır).

  4. 4

    Raporu okuyun

    Her A öğesi, en iyi B adayıyla ve bir güven puanıyla eşleştirilir. Belirlenen eşik değerin altındaki öğeler inceleme için işaretlenir.

Benzerlik nasıl ölçülür?

Bu araç, PHP’nin similar_text işlevini (en uzun ortak alt dizi puanı) kullanır ve sonucu yüzde olarak raporlar. Değer ne kadar yüksekse o kadar iyidir; tam eşleşme %100’dür.

Eşik Davranış
≥ 95% Neredeyse aynı, yalnızca büyük/küçük harf veya boşluk farkları
80–94% Yazım hataları, eksik noktalama, kısaltılmış son ekler
60–79% Kelime sırası değişiklikleri, kısaltmalar ve tam biçimler
< 60% Muhtemelen gerçek bir eşleşme değil, elle kontrol edin

İpuçları

  • Önce normalleştirin, yaygın gürültüyü biliyorsanız: küçük harfe çevirin, noktalamayı kaldırın, boşlukları sıkıştırın. Daha isabetli puanlar alırsınız.
  • Şirket son eklerini kaldırın (“Inc”, “Ltd”, “GmbH”), bir listede tutarsız görünüp diğerinde görünmüyorlarsa.
  • Uzun adresleri bölün, “sokak + şehir” bilgisini ayrı ayrı eşleştirmek, birleştirilmiş tek bir satırı eşleştirmekten daha iyi sonuç verir.
  • Birden çoğa eşleşmeye dikkat edin. Araç, her A girişi için en iyi B eşleşmesini seçer; aynı B’nin birden fazla A satırıyla eşleşmesini engellemez.

Daha katı bir algoritmayı ne zaman kullanmalıyız?

Büyük ölçekli dedüplikasyon işlemlerinde Levenshtein mesafesi veya Jaro–Winkler yöntemi, özellikle karakter konumunun önemli olduğu isimlerde similar_text’den daha iyi sonuçlar verir. Belirli ücretlendirmeler veya birleştirme işlemlerinde bulanık eşleme kullanılıyorsa, büyük ölçekli çıktıya güvenmeden önce 20 rastgele çifti kontrol edin.

Sık Sorulan Sorular

Yüzde 70’lik oran, çoğu geçerli eşleşmeyi yakalarken gerçek kaçırmaları da işaretler. B listesi temizse ve yanlış pozitiflere tahammülünüz yoksa oranı yüzde 85’e sıkılaştırın; her iki liste de gürültülüyse ve her şeyi elle incelemeyi planlıyorsanız yüzde 55’e gevşetin.

Evet, ancak önce verileri standart hale getirin: boşlukları, tireleri ve ülke kodu ön eklerini kaldırın, e-posta adreslerini küçük harfe çevirin. Ham değerler üzerinde yapılan bulanık eşleştirme, yapısal olarak aynı olan girişlere düşük puanlar verecektir.

Araç, karşılaştırmadan önce her iki tarafı da dahili olarak küçük harfe çevirir; bu nedenle “Apple” ve “apple” %100 puan alır.

Evet, eşleştirme sunucu tarafında çalışır, dolayısıyla iki listeniz karşılaştırılmak üzere araca gönderilir. Yalnızca o tek istek için bellekte işlenir ve sonrasında saklanmaz veya kaydedilmez.

İlgili Araçlar

Araç diğer dillerde mevcuttur