CSV Yinelenen Satır Temizleyici

Yinelenen satırlar CSV dışa aktarımlarına can sıkıcı yollarla sızar: tekrarlanan webhook teslimatları, elle uç uca eklenmiş iki rapor ya da beklemediğiniz satırları çoğaltan bir birleştirme (join) işlemi. Bu araç her veri satırının karma (hash) değerini hesaplar ve yalnızca ilk görülen satırı tutar; böylece çıktı, orijinal satır sıranızı korurken kopyaları sessizce eler. Başlık satırı isteğe bağlıdır: dosyanız doğrudan verilerle başlıyorsa ilgili seçeneği değiştirin.

Yinelenen satır temizleme nasıl çalışır

  1. 1

    CSV verisini yapıştırın

    Başlık satırını dahil edin veya hariç tutun; hangisi olduğunu araca bildirmek için onay kutusunu kullanın.

  2. 2

    Her satırın karması hesaplanır

    Satırlar dizilere ayrıştırılır ve JSON gösterimlerinin MD5 değeri benzersizlik anahtarı olarak kullanılır.

  3. 3

    İlk görülen kazanır

    Belirli bir karma değerine sahip ilk satır tutulur. Aynı içeriğe sahip sonraki satırlar sessizce atlanır.

  4. 4

    Başlık korunur

    Başlık modu açıkken 1. satır, verilere göre yinelenme kontrolüne tabi tutulmadan her zaman olduğu gibi aktarılır.

Ne yinelenen satır sayılır

Bu araç tam satır eşitliğini kullanır. Standart CSV ayrıştırmasından sonra her hücre konum konum eşleştiğinde iki satır yinelenmiş sayılır.

Yine de farklı sayılan durumlar

Satır A Satır B Değerlendirme
Alice,30,Paris Alice, 30, Paris Farklı (fazladan boşluk)
Bob,25 Bob,25, Farklı (sonda boş hücre)
"Jane Smith",42 Jane Smith,42 Aynı (tırnaklama ayrıştırıcı düzeyinde ele alınır)
TRUE,1 true,1 Farklı (büyük/küçük harfe duyarlı)

Sütun düzeyinde temizlemenin daha uygun olduğu durumlar

Tam satır eşleştirmesi katıdır; genellikle istediğiniz de budur, ancak bazen gerçekten “diğer sütunlardan bağımsız olarak her e-posta için tek satır” istersiniz. Bu durumda önce CSV Sütun Ayıklayıcı ile dosyayı yalnızca anahtar sütuna indirin, o sütunda yinelenenleri temizleyin ve sonucu bir arama tablosu olarak kullanın. Ya da SQL’e başvurun: PostgreSQL’de SELECT DISTINCT ON (email) * FROM users ORDER BY email, created_at DESC;, başka veritabanlarında ise MIN() toplama işleviyle bir GROUP BY.

Pratik ipuçları

  • Temizlemeden önce normalleştirin. Önce anahtar sütunlardaki boşlukları kırpın ve büyük/küçük harf kullanımını standartlaştırın; aksi halde ALICE@EXAMPLE.COM ve alice@example.com birlikte hayatta kalır.
  • Denetlenebilir sonuçlar için önce sıralayın, sonra temizleyin. Hangi kopyanın tutulduğunu bilmeniz gerekiyorsa, aracı çalıştırmadan önce CSV’yi tercih ettiğiniz eşitlik bozma ölçütüne (en yeni zaman damgası, en düşük kimlik) göre sıralayın.
  • Satır sayısını kontrol edin. Kaç yinelenen satırın kaldırıldığını doğrulamak için hem orijinalde hem de çıktıda CSV Satır Sayacı’nı kullanın.

Sık Sorulan Sorular

Hayır, ayrıştırılmış satırların tamamının karmasını hesaplar. Tek sütun benzersizliği için önce CSV Sütun Ayıklayıcı ile CSV’yi yalnızca o sütuna daraltın, ardından bu aracı çalıştırın.

Dosyadaki ilk görülen satır. Belirli bir kopyanın (en yeni kayıt, en düşük kimlik vb.) kazanmasını istiyorsanız, CSV’yi önceden sıralayın.

Evet. Satırlar standart CSV kurallarıyla ayrıştırılır; bu nedenle "Jane, Smith" tek bir hücre olarak kalır ve öyle karşılaştırılır.

CSV dosyası, yinelenenleri temizleme işlemini hesaplamak için sunucumuza gönderilir. Dosya saklanmaz, paylaşılmaz ve sayfa bağlantısına eklenmez.

İlgili Araçlar

Araç diğer dillerde mevcuttur