Ana içeriğe geç
Programlama

UTF-8000 kodlama protokolü karakter sınırını kaldırıyor

Öne çıkanlar

  • UTF-8000 protokolü ASCII ve UTF-8 ile geriye dönük tam uyumluluk sunuyor.
  • Sekiz baytı aşan dizilerde başlangıç bitleri devam baytlarına yayılarak sınırsız kodlama alanı açıyor.
  • Bayt dizilimi korunduğu için C kütüphanesindeki strcmp işlevi doğrudan çalışmayı sürdürüyor.

Geliştiriciler tarafından bağımsız bir proje olarak sunulan UTF-8000 protokolü, standart UTF-8 mimarisini temel alarak sınırsız büyüklükteki karakter kodlarını destekleyecek şekilde genişletti. Unicode Konsorsiyumu tarafından resmi olarak onaylanmayan bu çalışma, mevcut UTF-8 ve ASCII standartlarıyla tam uyumluluk sağlıyor. Yeni sistem, mevcut mimarinin temel özelliklerini bozmadan bayt dizilimini genişletmeyi hedefliyor.

Tasarım, ilk bayttaki en yüksek bitleri eşzamanlama ve başlangıç bitleri olarak ayrıştırıyor. Sekiz bayttan daha uzun kod birimleri için başlangıç bitleri sonraki devam baytlarına yayılarak teorik olarak sınırsız uzunlukta veri saklama imkanı tanıyor. İki bayttan uzun dizilerde sistem her ek bayt ile 5 yeni içerik biti kazanıyor ve genel bilgi oranı yaklaşık yüzde 62,5 seviyesine yakınsıyor.

Sistem, UTF-8 protokolünün kendi kendine eşzamanlanma ve uzunluk belirleme gibi temel mimari avantajlarını olduğu gibi sürdürüyor. Kodlanan diziler bayt düzeyinde sıralandığında C standart kütüphanesindeki strcmp işleviyle çözümleme gerekmeksizin karşılaştırılabiliyor. Geliştiriciler, referans uygulamanın pipx paket yöneticisi üzerinden test edilebileceğini açıkladı.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.