Metinden URL'leri Çıkarma

Bir sohbet dökümü, Markdown belgesi, e-posta dizisi veya ham HTML verisi yapıştırın ve içindeki tüm http:// ve https:// bağlantılarından oluşan temiz bir liste elde edin. Araç sondaki noktalama işaretlerini ayıklar, Markdown ve HTML bağlantı yazımını tanır ve birebir aynı olan kopyaları kaldırır, böylece listeyi doğrudan bir tarayıcıya veya arşivleme aracına aktarabilirsiniz.

URL'ler nasıl çıkarılır

  1. 1

    Kaynağı yapıştırın

    Metni veya HTML'i ekleyin. Tırnak işaretleri, köşeli parantezler, Markdown bağlantı yazımı ve sondaki noktalama işaretleri otomatik olarak işlenir.

  2. 2

    Taramayı çalıştırın

    Tüm `http://` ve `https://` bağlantıları bulunur, sondaki noktalama işaretleri ayıklanır ve birebir aynı kopyalar kaldırılır.

  3. 3

    Sayıyı gözden geçirin

    Kaç benzersiz URL bulunduğunu ve tam listeyi görürsünüz.

  4. 4

    Kopyalayın veya dışa aktarın

    Her satırda bir URL; `curl -I`, bir arşivleyici, ekran görüntüsü hizmeti veya Screaming Frog tohum listeleri için hazırdır.

Bir URL olarak kabul edilen nedir?

URL tespiti göründüğünden daha zordur ve bu çıkarıcı bilinçli olarak tek bir güvenli kurala bağlı kalır: yalnızca tam http:// ve https:// bağlantılarını alır. Geri kalan her şey metninizde kalır.

Tanınan şekiller

Şekil Örnek
Mutlak HTTPS https://example.com/path?q=1
Mutlak HTTP http://example.com
Markdown bağlantısının hedefi [text](https://example.com)
HTML içinde mutlak href href="https://example.com"

Kesme kuralları

Sondaki noktalama işaretleri ayıklanır, bu nedenle (https://example.com). ifadesi https://example.com olur. Boşluk, tırnak işareti, köşeli parantez, yay ayraç, köşeli ayraç, virgül ve noktalı virgül eşleşmeyi durdurur. Parantez içeren bir URL ilk açan parantezde kesilir; Wikipedia tarzı bir başlık yalnızca açan paranteze kadar yakalanır.

Nelerin atlandığı

  • mailto:, tel:, ftp: ve http veya https olmayan diğer tüm şemalar.
  • //cdn.example.com/asset.js gibi protokole göreli bağlantılar.
  • example.com/docs/intro veya www.example.com/page gibi şeması olmayan çıplak alan adları ve www. ön ekli adresler.
  • Yalnızca #section gibi çapalar ve JavaScript sözde URL'leri.

Kopyalar nasıl ele alınır?

Birebir aynı kopyalar kaldırılır: https://example.com kaç kez geçerse geçsin bir kez sayılır, Example.com ve example.com ise ayrı kayıtlar olarak kalır. Liste, her URL'nin ilk görüldüğü sırayı korur.

Sonradan işleme ipuçları

  • Kanonik tekilleştirme için küçük harfe çevirin. Example.com ve example.com aynı ana bilgisayar sayılacaksa, çıktıyı küçük harfe çevirip yeniden tekilleştirin.
  • İzleme parametrelerini kaldırın. Arşivlemeden önce bir UTM temizleyici kullanın; aksi takdirde onlarca neredeyse aynı kopyayla karşılaşırsınız.
  • Durumu kontrol edin. Listeyi kesinleştirmeden önce 404 hatalarını ayıklamak için bir kırık bağlantı denetleyicisinden geçirin.

Sık Sorulan Sorular

Yalnızca kısa bağlantı şemayla birlikte yazıldıysa. Tek başına bit.ly/xyz yakalanmaz, ancak https://bit.ly/xyz normal bir URL olarak işlenir. Çıkarıcı yönlendirmeleri izlemez; nihai hedefe ihtiyacınız varsa bunları ayrıca çözümleyin.

Evet, href tam bir http:// veya https:// URL’si olduğunda. Değer, çevresindeki etiket olmadan temiz bir şekilde çıkarılır; göreli href’ler yakalanmaz.

Olduğu gibi korunur. utm_* ve benzeri izleme parametrelerini kaldırmak istiyorsanız, çıkarma sonrasında bir URL temizleme aracı kullanın.

Hayır. Metin istek sırasında işlenir ve içerik saklanmaz veya kaydedilmez.

İlgili Araçlar

Araç diğer dillerde mevcuttur