Common Crawl verileri Hugging Face depolarına taşındı
Öne çıkanlar
- Common Crawl arşivleri Hugging Face Storage Bucket üzerinden doğrudan erişime açıldı.
- hf-mount aracı ve S3 uyumlu API sayesinde arşivler yerel dosya sistemi gibi kullanılabiliyor.
- Parquet biçimindeki URL dizini DuckDB ile indirilmeden doğrudan sorgulanabiliyor.
- Hugging Face içi transferlerde saniyede 1.500 kayda kadar indirme hızına ulaşıldı.
Açık web veri arşivi projesi Common Crawl, tarama verilerini Amazon S3 platformuna ek olarak Hugging Face Storage Bucket üzerinde kullanıma açtı. Nisan 2026 itibarıyla başlatılan bu adım sayesinde araştırmacılar ve geliştiriciler, devasa web arşivine Hugging Face ekosistemindeki yerel araçlar üzerinden doğrudan erişebiliyor. Kullanıcılar verileri tarayıcıdan inceleyebiliyor, komut satırı aracıyla indirebiliyor veya yerel bir dosya sistemi gibi doğrudan bağlayabiliyor.
Hugging Face Hub üzerindeki nesne depolama alanı, S3 dizin yapısını birebir koruyarak mevcut yazılım boru hatlarıyla tam uyumluluk sunuyor. Geliştiriciler hf-mount aracı sayesinde tüm arşivi indirmeden dosya bazlı okuma yapabiliyor ya da S3 uyumlu API uç noktasını kullanarak mevcut kodlarını değiştirmeden verileri çekebiliyor. Python tarafında fsspec ve warcio araçları aracılığıyla WARC arşiv dosyaları uzaktan satır satır taranabiliyor.
Sistem aynı zamanda Common Crawl bünyesindeki Parquet tabanlı URL dizinini de barındırıyor ve analitik sorgular için DuckDB entegrasyonu sunuyor. Ekip tarafından yapılan ilk performans testlerinde, Hugging Face sunucuları arasında saniyede bin 500 kayda varan indirme hızları kaydedildi. Ancak küçük boyutlu aralık isteklerinde uç istemcilerin hız sınırı kısıtlamalarına takılabileceği ve geniş çaplı operasyonlar öncesinde test yapılması gerektiği aktarıldı.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.