HTML'den Metne Dönüştürücü

Sade metin e-postaları, metin analizi ve kelime sayımı işlemleri; hepsi HTML’in bir insanın ekranda gördüğü okunabilir dizeye, hiçbir biçimlendirme kalıntısı olmadan dönüştürülmesini gerektirir. HTML’yi yapıştırın; bu araç tüm etiketleri kaldırır, varlıkları çözer (&&), girintilerden kaynaklanan boşluk dizilerini birleştirir ve analiz için ya da çok parçalı bir e-postanın text/plain bölümü için kullanıma hazır, temiz ve okunabilir bir metin bloğu üretir.

HTML'yi metne nasıl dönüştürürüz?

  1. 1

    HTML'yi yapıştırın

    Her boyutta olabilir: kısa bir kod parçası, biçimlendirilmiş bir e-posta içeriği veya tam bir sayfa.

  2. 2

    Dönüştür

    Tek tık: tüm etiketler ve öznitelikler kaldırılır, varlıklar çözülür.

  3. 3

    Satır sonlarını inceleyin

    Paragraflar, liste maddeleri ve tablo satırları ayrı satırlara dönüşür; böylece metin yapısını korur.

  4. 4

    Metni kopyalayın

    Çıktı, saf Unicode metnidir; kelime sayacına, e-posta şablonuna veya duygu analizi modeline gönül rahatlığıyla verilebilir.

Dönüştürme işleminin karmaşık etiketleri nasıl işlediği

HTML’yi metne çevirmek yalnızca string.replace(/<[^>]+>/, "") işleminden ibaret değildir; basit bir düzenli ifade, varlık kodlarını ve girinti boşluklarını yerinde bırakır ve </p> etiketinin yeni bir satır başlatması gerektiğini bilmez.

Blok düzeyi etiketler ile satır içi etiketler

Blok düzeyindeki etiketler (<br> ve </p>, </div>, </h1> ile </h6>, </li>, </tr> kapanış etiketleri) her biri bir satır sonu oluşturur. Satır içi etiketler (<a>, <span>, <strong>) boşluk bırakmadığından kelimeler birbirine yapışmaz.

Etiketlere göre işleme

Etiket İşlem
<br> Bir satır sonu
</p>, </div>, </h1> ile </h6> Her kapanış etiketi için bir satır sonu
</li>, </tr> Bir satır sonu; madde işareti veya tablo hücre ayracı eklenmez
<a href="url">text</a> text; href özniteliği kaldırılır
<img alt="text"> Hiçbir şey, etiketin görünür metni yok
<script>, <style> Etiketler kaldırılır, aralarındaki metin korunur

Varlık (entity) çözme

  • Adlandırılmış varlıklar (&amp;, &copy;, &eacute;) karşılık gelen Unicode karakterlerine çözülür.
  • Sayısal varlıklar (&#169;, &#x00A9;) da çözülür.
  • Bilinmeyen varlıklar olduğu gibi korunur; böylece analiz araçları bunları görebilir.

Boşluk normalleştirme

  • Satır sonundan önceki boşluklar ve sekmeler kaldırılır.
  • Üç veya daha fazla boş satır tek bir boş satıra indirgenir.
  • Kelimeler arasındaki boşluklar olduğu gibi korunur; dönüştürücü metni yeniden düzenlemez.

Kullanım alanları

  • Çok parçalı bir e-postanın text/plain parçasını oluşturmak.
  • Çekilen makaleleri bir dil modeline vermeden önce temizlemek.
  • Sade metin arama dizinini beslemek.
  • Biçimlendirmeyi yok sayan dürüst bir kelime sayımı yapmak.

Sık Sorulan Sorular

Görsel biçimlendirme (kalın yazı, renk, yazı tipi) kaybolur, asıl amaç da budur. Yapı satır sonları olarak korunur: paragraflar, liste maddeleri ve tablo satırları ayrı satırlara dönüşür, böylece metin okunabilir kalır.

Bağlantının görünen metni kalır, ancak URL, etiket öznitelikleriyle birlikte kaldırılır. URL’lere ihtiyacınız varsa, bunun yerine HTML’yi Markdown’a dönüştüren özel bir araç kullanın.

Dönüştürücü etiketlerin kendisini kaldırır ama aralarındaki metni korur; bu yüzden <script> ve <style> bloklarının içeriği çıktıda kalır. İstemiyorsanız bunları önce kaynak HTML’den çıkarın.

Evet. Çıkış UTF-8 formatındadır ve girdideki tüm ASCII dışı karakterleri korur. &copy; ve &eacute; gibi entiteler, ilgili Unicode eşdeğerlerine dönüştürülür.

İlgili Araçlar

Araç diğer dillerde mevcuttur