Formát souboru sloupcového ukládání optimalizovaný pro zpracování velkých dat.
Typ souboru: Databáze
Formát souboru .parquet je sloupcové úložné technologie navržená pro efektivní zpracování a analýzu dat. Je široce používán v rámcích velkých dat, jako jsou Apache Hadoop, Apache Spark a další nástroje pro analytiku. Soubory v tomto formátu jsou optimalizovány pro výkon čtení a efektivitu uložiště.
Kategorie typu souboru:
Databáze
Datum aktualizace: 21. července 2026
Parquet je otevřený formát souborů sloupcového uložiště navržený tak, aby podporoval efektivní ukládání a načítání velkých datových souborů. Vytvořila ho nadace Apache Software Foundation jako součást ekosystému Apache Hadoop a stal se standardem ve zpracování velkých dat díky svým výkonovým výhodám.
Tento formát ukládá data ve sloupcově orientovaném způsobu, což umožňuje efektivnější kompresi a kódování, zejména u analytických dotazů, které přistupují pouze k vybraným sloupcům. Soubory Parquet mohou obsahovat složité vnořené datové struktury, což je činí vhodnými pro různé datové typy a schémata. Formát podporuje více algoritmů komprese, jako jsou SNAPPY, GZIP a LZO, což dále zlepšuje efektivitu ukládání.
Kompatibilní napříč různými platformami a jazyky, Parquet je podporován populárními rámcemi pro zpracování dat, jako jsou Apache Spark, Apache Drill, Hive a Pandas. Jeho návrh umožňuje rychlé dotazování a načítání, což z něj činí preferovanou volbu v oblasti datových skladů, strojového učení a analytiky velkých dat.
Pro otevření souboru .parquet můžete použít softwarové nástroje jako Apache Spark, Apache Drill nebo Hive na systémech Windows, Mac nebo Linux. Programy pro analýzu dat, jako je Pandas s Pythonem, také podporují čtení Parquet souborů prostřednictvím knihoven jako PyArrow nebo fastparquet. Specializované nástroje, jako je Parquet Viewer nebo Databricks, mohou nabídnout grafické rozhraní pro prohlížení a průzkum Parquet dat.
Převod jiných datových formátů na Parquet nebo z něj lze dosáhnout pomocí nástrojů jako Apache Spark, PyArrow nebo fastparquet v Pythonu. Tyto knihovny podporují čtení a zápis Parquet souborů a mohou být integrovány do datových pipelineů. Online převodníky pro Parquet jsou omezené, ale desktopové nástroje a příkazové řádky poskytují spolehlivé možnosti pro konverzi formátů. Například příkaz spark-submit od Apache Spark může efektivně převádět CSV, JSON nebo Avro soubory do formátu Parquet.