PDF'ten HTML'e Dönüştürücü

HTML’e dönüştür
Sonraki

Bu dönüştürücü, PDF’inizin metnini okur ve onu temiz, sade bir HTML dosyasına yerleştirir: sayfa başına bir <section>, bir <h2> sayfa başlığı ve <p> paragrafları. PDF.js kullanarak tamamen tarayıcınızda çalışır, bu yüzden dosya asla yüklenmez. Sonuç, açabileceğiniz, düzenleyebileceğiniz veya bir CMS’e yapıştırıp ardından kendi CSS’inizle biçimlendirebileceğiniz, yalnızca metinden oluşan sade bir HTML’dir. Tasarlanmış bir sayfayı yeniden oluşturmak için değil, bir PDF’in metnini web’e taşımak için yapılmıştır.

PDF'i HTML'e nasıl dönüştürürsünüz

  1. 1

    PDF'inizi seçin

    Metin tabanlı bir PDF'i kutuya sürükleyin veya gözatmak için tıklayın. Her şey tarayıcınızda kalır.

  2. 2

    HTML'e dönüştürün

    PDF.js her sayfayı okur ve metnini çıkarır, satırları paragraflar halinde gruplar.

  3. 3

    HTML'i inceleyin

    Oluşturulan işaretleme bir önizleme kutusunda görünür, böylece sonucu kontrol edebilirsiniz.

  4. 4

    Dosyayı indirin

    Sayfa başına bir bölüm içeren tek bir `.html` dosyasını kaydedin; düzenlemeye veya yeniden biçimlendirmeye hazırdır.

Çıktı nasıl görünür

Dönüştürücü, sade bir yapıya sahip geçerli bir HTML5 dosyası üretir:

Öğe Nereden gelir
<!DOCTYPE html> iskeleti UTF-8 karakter kümesine sahip standart bir HTML5 sarmalayıcı
<title> PDF’inizin dosya adı
<section data-page> Her PDF sayfası için bir blok
<h2>Sayfa N</h2> Her sayfanın başlangıcını işaretleyen bir başlık
<p> Dikey boşluğa göre paragraflar halinde gruplanan metin satırları

Ne yapmaz

Bu bir metin çıkarma aracıdır, bir yerleşim motoru değil. Çıktı bilerek şunları içermez:

  • PDF’teki resimler, logolar veya şekiller.
  • HTML <table>/<ul>/<ol> biçiminde tablolar, madde işaretli listeler veya numaralı listeler.
  • Özgün yazı tipleri, renkler, sütunlar veya konumlandırma.
  • Herhangi bir CSS veya satır içi stil.

Sözcükleri okuma sırasında, anlamsal paragraflara sarılmış olarak alırsınız, başka hiçbir şey değil. Kendi CSS’inizi sonradan ekleyin.

En iyi sonuçlar

  • Metin tabanlı bir PDF kullanın (bir okuyucuda metni seçebildiğiniz bir PDF). Taranmış veya yalnızca resimden oluşan PDF’lerde metin katmanı yoktur; burada OCR de yoktur, bu nedenle o sayfaların çıktısı boş olur.
  • Depoya kaydetmeden önce boşlukları düzenlemek için dosyayı prettier --parser html veya bir biçimlendiriciden geçirin.
  • WordPress’e mi taşıyorsunuz? HTML’i, onu yeniden saracak olan görsel düzenleyiciye değil, kod/HTML bloğuna yapıştırın.

Bir yerleşim aracı değildir

HTML’in PDF gibi görünmesini beklemeyin. Web akışkandır, bir PDF sayfası ise sabittir. İçeriği web’e taşımak istediğinizde bu aracı kullanın, ardından onu kendi sitenizin CSS’iyle yeniden biçimlendirin.

Sık Sorulan Sorular

Hayır. Araç metni çıkarır ve basit paragraflara yerleştirir. Yazı tipleri, renkler, sütunlar ve konumlandırma yeniden oluşturulmaz. Çıktıyı kendi CSS’inizle biçimlendirin.

Hayır. Yalnızca metin çıkarılır. Resimler, logolar ve şekiller HTML’e aktarılmaz.

Yalnızca PDF gerçek bir metin katmanına sahipse. Taranmış veya fotoğraflanmış sayfalar, seçilebilir metni olmayan resimlerdir ve burada OCR yoktur, bu yüzden o sayfalar hiç metin üretmez.

Hayır. Dönüştürmenin tamamı PDF.js ile tarayıcınızda çalışır. PDF asla cihazınızdan ayrılmaz, bu nedenle gizli belgeler için güvenlidir.

İlgili Araçlar

Araç diğer dillerde mevcuttur