Geliştirici posuto ile karmaşık Japon posta verisini temizledi
Öne çıkanlar
- Japonya Posta İdaresinin CSV dosyası 38 karakteri aşan mahalle adlarını birden fazla satıra bölüyor.
- Tek bir posta koduna ait kayıtlar adresleme yapısındaki karmaşıklık nedeniyle 66 satıra kadar çıkabiliyor.
- Posuto kütüphanesi bu verileri temizleyerek Python paketi ve JSON formatında kullanıma sunuyor.
Yazılımcı Paul O'Leary McCann, Japonya Posta İdaresi tarafından yayımlanan ve işlenmesi zorluğuyla bilinen posta kodu verilerini düzenleyen açık kaynaklı posuto kütüphanesini geliştirdi. "ken_all.csv" adlı resmi dosya, satır sırasına bağımlı parantez içi notlar ve tutarsız biçimlendirmeler nedeniyle geliştiriciler için uzun süredir ciddi sorunlar yaratıyordu.
Resmi CSV dosyasında belirli bir karakter sınırını aşan mahalle adları, diğer alanlar yinelenerek alt satırlara bölünüyor. Dosyada alıntı işaretleri yerine özel virgüller kullanılıyor ve adres satırlarında "aşağıdaki binalar hariç" gibi genel metinler yer alıyor. Sistemdeki karmaşıklık nedeniyle bazı posta kodları 66 satıra kadar yayılırken, Kyoto gibi geleneksel kavşak tabanlı adresleme kullanan bölgelerde tek bir kayıt sekiz satıra bölünüyor.
Resmi verideki bozuk romanizasyonları ve satır bölme kurallarını ayrıştıran posuto, Python kütüphanesi ve önceden işlenmiş JSON formatında kullanıcılara sunuldu. Proje, eski veri tabanı kısıtlamalarından kalan yapısal tutarsızlıkları modern sistemlerin doğrudan tüketebileceği standart bir veri setine dönüştürüyor.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.