Format pliku do przechowywania kolumnowego zoptymalizowany do przetwarzania dużych zbiorów danych.
Typ pliku: Plik bazy danych
Format pliku .parquet to technologia przechowywania kolumnowego zaprojektowana do wydajnego przetwarzania i analizy danych. Jest szeroko stosowany w ramach systemów big data, takich jak Apache Hadoop, Apache Spark oraz innych narzędzi analitycznych. Pliki w tym formacie są zoptymalizowane pod kątem wydajności odczytu i efektywności przechowywania.
Kategoria typu pliku:
Plik bazy danych
Data aktualizacji: 21 lipca 2026
Parquet to otwarty format plików do przechowywania danych kolumnowych, opracowany w celu wspierania efektywnego przechowywania i odzyskiwania dużych zbiorów danych. Został stworzony przez Apache Software Foundation jako część ekosystemu Apache Hadoop i stał się standardem w przetwarzaniu big data ze względu na swoje zalety wydajnościowe.
Ten format przechowuje dane w sposób kolumnowy, co umożliwia bardziej efektywną kompresję i kodowanie, zwłaszcza dla zapytań analitycznych, które sięgają tylko do wybranych kolumn. Pliki Parquet mogą zawierać złożone struktury danych zagnieżdżonych, dzięki czemu są odpowiednie dla różnych typów i schematów danych. Format obsługuje wiele algorytmów kompresji, takich jak SNAPPY, GZIP i LZO, co dodatkowo zwiększa efektywność przechowywania.
Zgodny na wielu platformach i w różnych językach, Parquet jest obsługiwany przez popularne frameworki do przetwarzania danych, takie jak Apache Spark, Apache Drill, Hive i Pandas. Jego projekt umożliwia szybkie zapytania i odzyskiwanie danych, czyniąc go preferowanym wyborem w data warehousing, uczeniu maszynowym i analizie big data.
.parquet, możesz użyć narzędzi programowych takich jak Apache Spark, Apache Drill lub Hive na systemach Windows, Mac lub Linux. Programy do analizy danych, takie jak Pandas z Pythonem, również obsługują odczyt plików Parquet za pomocą bibliotek takich jak PyArrow lub fastparquet. Specjalistyczne narzędzia, takie jak Parquet Viewer czy Databricks, mogą oferować graficzne interfejsy do przeglądania i eksploracji danych Parquet.
Konwersja innych formatów danych na Parquet lub z niego możliwa jest przy użyciu narzędzi takich jak Apache Spark, PyArrow lub fastparquet w Pythonie. Te biblioteki obsługują odczyt i zapis plików Parquet i mogą być zintegrowane z pipeline'ami danych. Online'owe konwertery do Parquet są ograniczone, ale narzędzia desktopowe i narzędzia wiersza poleceń zapewniają niezawodne opcje konwersji formatów. Na przykład polecenie spark-submit Apache Spark może efektywnie konwertować pliki CSV, JSON lub Avro do formatu Parquet.