Unicode Arama

Gizemli bir karakter bırakın, kullanıcınızın yapıştırdığı tuhaf boşluk, bir yazı tipi önizlemesinden bir glif, regex’inizi bozan bir emoji, ve arama, onun Unicode kod noktasını (U+XXXX) ve onaltılık cinsinden ham UTF-8 baytlarını, her karakter için bir satır olarak döndürür.

Bir Unicode karakteri nasıl tanımlanır

  1. 1

    Karakteri yapıştırın

    Tek bir glif ya da koca bir dizgi yapıştırabilirsiniz: her karakter sırayla çözümlenir.

  2. 2

    Kod noktasını okuyun

    Kanonik U+ gösterimini büyük harfle, en az dört onaltılık basamağa sıfır doldurulmuş olarak alın.

  3. 3

    UTF-8 baytlarını inceleyin

    Karakterin diskte ya da telde kapladığı 1–4 baytlık diziyi görün.

  4. 4

    Sonuçları kopyalayın

    Çıktı, CSV biçiminde bir tablodur (karakter, kod noktası, UTF-8 baytları); seçip bir elektronik tabloya ya da hata raporuna yapıştırabilirsiniz.

Bir aramayla yapabileceğiniz tipik dedektiflik işi

Çoğu Unicode hatası ekranda birbirinin aynı görünür. Normal bir boşluğu kırılmaz boşluktan ya da kıvrık bir kesme işaretini bir prime’dan ayırmanın tek yolu kod noktasını incelemektir.

Aramanın çözdüğü yaygın tuzaklar

Şuna benzer Aslında şudur Kod noktası
Boşluk Kırılmaz boşluk U+00A0
Boşluk Dar kırılmaz boşluk U+202F
(hiçbir şey) Sıfır genişlikli boşluk U+200B
(hiçbir şey) Sıfır genişlikli birleştirici U+200D
Kesme işareti Sağ tek tırnak işareti U+2019
Kesme işareti Prime (fit/dakika) U+2032
Tire En çizgisi U+2013
Tire Kırılmaz tire U+2011

Bir bakışta UTF-8 bayt düzeni

  • 1 bayt, ASCII, U+0000’den U+007F’ye (0xxxxxxx)
  • 2 bayt, Latin eki, Arapça, İbranice (110xxxxx 10xxxxxx)
  • 3 bayt, CJK, çoğu simge (1110xxxx 10xxxxxx 10xxxxxx)
  • 4 bayt, Emoji, nadir yazılar (11110xxx 10xxxxxx 10xxxxxx 10xxxxxx)

Veritabanı sütununuz sabit bayt uzunluğundaysa, 4 baytlık bir emoji tek bir glif olarak işlense bile dört yuvayı yer, yaygın bir kesme hatası kaynağı.

Sık Sorulan Sorular

Genellikle dosyanın başındaki BOM işaretleri (U+FEFF) ya da bir kelime işlemciden başıboş sıfır genişlikli birleştiriciler. Birini aramaya yapıştırın, hemen size söyleyecek, sonra onları basit bir bul-ve-değiştir ile temizleyebilirsiniz.

Evet. Arama karakter karakter ilerler, dolayısıyla koca bir sözcük, her karakter için kod noktası ve UTF-8 baytlarıyla bir satır üretir.

Bir kod noktası, bir karakterin soyut kimliğidir, U+00E9, onu nerede saklarsanız saklayın her zaman “é”dir. UTF-8, bir kod noktasını baytlara çeviren çeşitli kodlamalardan biridir; aynı “é”, UTF-8’de C3 A9 iki baytıdır ama Latin-1’de tek bayt E9’dur.

Evet. Arama sunucumuzda hesaplanır: yapıştırdığınız karakterler gönderilir, çözümlenir ve kod noktası ile UTF-8 baytları hemen döndürülür. Gönderdiğiniz metni saklamayız.

İlgili Araçlar

Araç diğer dillerde mevcuttur