Ir al contenido
SparquetSparquet

Instalación

Python 3.9 o superior
Java 11 o 17 — lo exige el propio Spark (JAVA_HOME apuntando a él)
PySpark 3.4 o superior, instalado como dependencia
Node.js 18.18+ — solo para Sparquet Studio

En una plataforma gestionada (Databricks, EMR, Dataproc, Synapse) Spark y Java ya están; solo instalas el framework.

Terminal window
pip install sparquet

Comprueba la instalación:

from sparquet import Sparquet
print(Sparquet)
Extra Instalación Cuándo lo necesitas
Delta Lake (OSS) pip install "sparquet[delta]" Tablas Delta fuera de Databricks
Iceberg paquete Spark en el clúster Tablas Iceberg
Kafka paquete Spark en el clúster Publicar en un tópico

Los paquetes de conector se declaran por pipeline, así el trabajo lleva su propia dependencia:

{
"spark": {
"configs": {
"spark.jars.packages": "io.delta:delta-spark_2.12:3.2.0"
}
}
}

El Studio es una aplicación estática — no necesita servidor para diseñar pipelines.

  1. Clona el repositorio e instala:

    Terminal window
    git clone https://github.com/VictorPasqualini/sparquet.git
    cd sparquet/sparquet-studio
    npm install
  2. Arráncalo:

    Terminal window
    npm run dev
  3. Abre http://localhost:5273. El primer arranque crea un Workflow Getting Started con Jobs que funcionan.

Para alojarlo, genera el bundle estático y cópialo donde quieras:

Terminal window
npm run build # → dist/
npm run preview # sirve el build en local

Diseñar solo necesita el navegador. Ejecutar desde el lienzo necesita Spark, así que el Studio incluye un pequeño servicio que levantas tú:

Terminal window
cd sparquet-studio
pip install -r server/requirements.txt
uvicorn server.main:app --port 8787

Imprime un token al arrancar; pégalo en Settings → Local runner del Studio. El procedimiento completo está en Ejecutar un Job.

Escribe tu primer pipeline — cinco minutos, sin Studio.