Formato di file per memorizzazione a colonne ottimizzato per l'elaborazione di big data.
Tipo di file: File di database
Il formato di file .parquet è una tecnologia di storage a colonne progettata per un'elaborazione e analisi dei dati efficiente. È ampiamente utilizzato in framework di big data come Apache Hadoop, Apache Spark e altri strumenti di analisi. I file in questo formato sono ottimizzati per le prestazioni di lettura e l'efficienza dello storage.
Categoria tipo di file:
File di database
Data aggiornamento: 21 luglio 2026
Parquet è un formato di file di archiviazione colonnare open-source sviluppato per supportare l'archiviazione e il recupero efficienti di grandi set di dati. È stato creato dalla Apache Software Foundation come parte dell'ecosistema Apache Hadoop ed è diventato uno standard nell'elaborazione di big data grazie ai suoi vantaggi in termini di prestazioni.
Questo formato memorizza i dati in modo orientato alle colonne, il che consente una compressione e una codifica più efficienti, specialmente per le query analitiche che accedono solo a un sottoinsieme di colonne. I file Parquet possono contenere strutture di dati annidate complesse, rendendoli adatti a diversi tipi di dati e schemi. Il formato supporta molteplici algoritmi di compressione come SNAPPY, GZIP e LZO, migliorando ulteriormente l'efficienza dello spazio di archiviazione.
Compatibile su diverse piattaforme e linguaggi, Parquet è supportato da framework di elaborazione dati popolari come Apache Spark, Apache Drill, Hive e Pandas. La sua progettazione consente interrogazioni e recuperi rapidi, rendendolo una scelta preferita nelle applicazioni di data warehousing, machine learning e big data analytics.
Per aprire un file .parquet, puoi usare strumenti software come Apache Spark, Apache Drill o Hive su sistemi Windows, Mac o Linux. Programmi di analisi dei dati come Pandas con Python supportano anche la lettura di file Parquet tramite librerie come PyArrow o fastparquet. Strumenti specializzati come Parquet Viewer o Databricks possono offrire interfacce grafiche per visualizzare e esplorare i dati Parquet.
Convertire altri formati di dati to o da Parquet può essere eseguito utilizzando strumenti come Apache Spark, PyArrow o fastparquet in Python. Queste librerie supportano la lettura e la scrittura di file Parquet e possono essere integrate in pipeline di dati. I convertitori online per Parquet sono limitati, ma strumenti desktop e utility da riga di comando offrono opzioni affidabili per la conversione di formato. Per esempio, il comando spark-submit di Apache Spark può convertire file CSV, JSON o Avro in modo efficiente nel formato Parquet.