Format file penyimpanan kolom yang dioptimalkan untuk pemrosesan data besar.
Jenis file: Berkas Database
Format file .parquet adalah teknologi penyimpanan kolom yang dirancang untuk pemrosesan dan analisis data yang efisien. Ini banyak digunakan dalam kerangka data besar seperti Apache Hadoop, Apache Spark, dan alat analitik lainnya. File dalam format ini dioptimalkan untuk kinerja baca dan efisiensi penyimpanan.
Kategori jenis file:
Berkas Database
Tanggal diperbarui: 21 Juli 2026
Parquet adalah format file penyimpanan kolom sumber terbuka yang dikembangkan untuk mendukung penyimpanan dan pengambilan data dalam jumlah besar secara efisien. Format ini dibuat oleh Apache Software Foundation sebagai bagian dari ekosistem Apache Hadoop dan telah menjadi standar dalam pemrosesan data besar karena keunggulan kinerjanya.
Format ini menyimpan data secara kolom-oriented, yang memungkinkan kompresi dan pengkodean yang lebih efisien, terutama untuk kueri analitik yang hanya mengakses sebagian kolom. File Parquet dapat mengandung struktur data bersarang yang kompleks, membuatnya cocok untuk berbagai tipe data dan skema. Format ini mendukung beberapa algoritma kompresi seperti SNAPPY, GZIP, dan LZO, yang semakin meningkatkan efisiensi penyimpanan.
Kompatibel di berbagai platform dan bahasa, Parquet didukung oleh kerangka kerja pemrosesan data populer seperti Apache Spark, Apache Drill, Hive, dan Pandas. Desainnya memungkinkan kueri dan pengambilan data yang cepat, menjadikannya pilihan utama dalam data warehousing, machine learning, dan aplikasi analitik data besar.
Untuk membuka file .parquet, Anda dapat menggunakan alat perangkat lunak seperti Apache Spark, Apache Drill, atau Hive di sistem Windows, Mac, atau Linux. Program analisis data seperti Pandas dengan Python juga mendukung pembacaan file Parquet melalui pustaka seperti PyArrow atau fastparquet. Alat khusus seperti Parquet Viewer atau Databricks dapat menawarkan antarmuka grafis untuk melihat dan menjelajah data Parquet.
Mengonversi format data lain ke atau dari Parquet dapat dilakukan menggunakan alat seperti Apache Spark, PyArrow, atau fastparquet dalam Python. Perpustakaan ini mendukung pembacaan dan penulisan file Parquet dan dapat diintegrasikan ke dalam pipeline data. Konverter online untuk Parquet terbatas, tetapi alat desktop dan utilitas command-line menyediakan opsi yang andal untuk konversi format. Sebagai contoh, perintah spark-submit dari Apache Spark dapat mengonversi file CSV, JSON, atau Avro ke dalam format Parquet secara efisien.