Rediscount

Intelligenza artificiale

Hugging Face Storage Buckets: come funziona il nuovo ciclo di dati per i robot

Un'analisi tecnica del flusso di lavoro unificato per la robotica basato su Strands Robots, LeRobot e i nuovi Storage Buckets di Hugging Face.

Hugging Face Storage Buckets: come funziona il nuovo ciclo di dati per i robot
Foto di Alberlan Barros · Pexels

Gestire flussi continui di dati per l'addestramento di modelli di intelligenza artificiale applicata alla robotica richiede un'infrastruttura efficiente, capace di evitare il trasferimento ridondante di gigabyte di video e telemetria. Il framework open source Strands Robots, sviluppato su AWS, introduce un ciclo di lavoro integrato che unisce la registrazione delle dimostrazioni, l'archiviazione e l'addestramento diretto dei modelli sfruttando i nuovi Storage Buckets di Hugging Face.

Questo approccio risolve uno dei problemi principali nello sviluppo di policy per bracci robotici e umanoidi: evitare che ogni ciclo di addestramento comporti il download integrale di dataset in costante crescita, riducendo drasticamente i costi di banda e i tempi di attesa per le GPU.

Cosa cambia nel flusso di lavoro per gli sviluppatori

Il sistema si basa su un'architettura unificata in cui lo stesso oggetto robotico gestisce sia la fase di acquisizione dei dati sia la riproduzione in simulazione o su hardware reale. I punti chiave del sistema includono:

  • Storage Buckets mutabili: a differenza dei classici repository di dataset con versionamento a commit, i bucket consentono di scrivere e sovrascrivere i dati nello stesso spazio di lavoro senza overhead di gestione IAM o configurazioni CORS complesse.
  • Deduplicazione a livello di byte: grazie alla tecnologia Xet e al chunking basato sui contenuti, la sincronizzazione successiva di una sessione di registrazione carica unicamente i blocchi modificati o aggiunti, riducendo il traffico dati fino a quattro volte.
  • Streaming diretto senza download: i dataset vengono letti in streaming direttamente dai frammenti Parquet e MP4 remoti, consentendo l'avvio immediato dell'addestramento PyTorch senza occupare spazio su disco locale con copie intere.
  • Compatibilità hardware nativa: lo stesso formato di dataset LeRobot è utilizzabile sia in simulazione sia su bracci robotici fisici, permettendo il passaggio dal codice di test al dispiegamento su hardware modificando un singolo parametro.

Cosa significa per chi sviluppa in Europa

Per i team di ricerca e le aziende italiane che lavorano con la robotica basata su machine learning, l'adozione di questa infrastruttura semplifica la pipeline di sviluppo locale e su cluster cloud. La possibilità di eseguire la registrazione, la validazione degli episodi e il fine-tuning delle policy con dipendenze minime (Python 3.12, librerie MuJoCo e supporto CUDA per l'inferenza VLA) riduce la barriera d'ingresso per progetti di automazione avanzata.

Inoltre, la gestione delle aree geografiche tramite le impostazioni di Storage Regions sui piani Team ed Enterprise di Hugging Face consente di indirizzare la memorizzazione dei dati nei datacenter dell'Unione Europea, un fattore cruciale per la conformità normativa e per sfruttare le cache CDN locali capaci di accelerare la lettura dei dati video durante l'addestramento su GPU.

Per approfondire le novità hardware e i componenti necessari per assemblare postazioni di sviluppo robotiche, consulta le nostre guide e notizie Rediscount dedicate ai componenti PC e alle soluzioni di calcolo avanzate.

Domande frequenti

I dati registrati nei bucket rimangono in Europa?

Sì, utilizzando i piani Team ed Enterprise di Hugging Face è possibile configurare le Storage Regions scegliendo l'Unione Europea per rispettare i requisiti di residenza dei dati.

È necessario scaricare l'intero dataset prima di avviare l'addestramento?

No, il sistema sfrutta lo streaming basato su byte-range per alimentare i DataLoader di PyTorch fotogramma per fotogramma, evitando il download locale dei file video e parquet.

Quali requisiti hardware servono per eseguire la pipeline di base?

Per la sola fase di simulazione e registrazione con criteri mock è sufficiente un normale computer portatile con Linux o macOS (inclusi i chip Apple Silicon). Per l'addestramento su larga scala delle policy è invece necessaria una GPU NVIDIA dedicata.

Il formato dei dati è compatibile con altre piattaforme robotiche?

Sì, l'adozione dello standard LeRobot garantisce la compatibilità con migliaia di dataset e modelli già pubblicati sull'Hub senza necessità di conversioni preventive.

Visualizza cookie policy completa

Questo pannello consente di esprimere il consenso alle tecnologie di tracciamento utilizzate da ReDiscount.it. Maggiori informazioni nella Informativa Cookie. Puoi modificare la scelta in qualsiasi momento tramite Preferenze Cookie nel piè di pagina.

Strettamente necessari

Questi strumenti di tracciamento sono strettamente necessari per garantire il funzionamento e la fornitura del servizio che ci hai richiesto e, pertanto, non richiedono il tuo consenso.

  • rd_consent — preferenze Cookie, 180 giorni, prima parte
  • rd_list_view — vista elenco o griglia, 1 anno, prima parte

Cookie analitici — Google Analytics 4

Google Analytics 4 raccoglie informazioni statistiche sull’utilizzo del Sito (pagine visitate, durata delle visite, dispositivo, provenienza del traffico). Non viene utilizzato per pubblicità comportamentale o retargeting. Si attiva soltanto dopo il consenso.

  • _ga — Google Analytics 4, 2 anni, terza parte (Google)
  • _ga_* — Google Analytics 4, 2 anni, terza parte (Google)