Instalación
Requisitos
Sección titulada «Requisitos»| Python | 3.9 o superior |
| Java | 11 o 17 — lo exige el propio Spark (JAVA_HOME apuntando a él) |
| PySpark | 3.4 o superior, instalado como dependencia |
| Node.js | 18.18+ — solo para Sparquet Studio |
En una plataforma gestionada (Databricks, EMR, Dataproc, Synapse) Spark y Java ya están; solo instalas el framework.
El framework
Sección titulada «El framework»pip install sparquetgit clone https://github.com/VictorPasqualini/sparquet.gitcd sparquetpip install -e .Añade sparquet a las librerías del clúster, o instálalo en un cuaderno:
%pip install sparquetdbutils.library.restartPython()Comprueba la instalación:
from sparquet import Sparquetprint(Sparquet)Extras opcionales
Sección titulada «Extras opcionales»| Extra | Instalación | Cuándo lo necesitas |
|---|---|---|
| Delta Lake (OSS) | pip install "sparquet[delta]" |
Tablas Delta fuera de Databricks |
| Iceberg | paquete Spark en el clúster | Tablas Iceberg |
| Kafka | paquete Spark en el clúster | Publicar en un tópico |
Los paquetes de conector se declaran por pipeline, así el trabajo lleva su propia dependencia:
{ "spark": { "configs": { "spark.jars.packages": "io.delta:delta-spark_2.12:3.2.0" } }}Sparquet Studio
Sección titulada «Sparquet Studio»El Studio es una aplicación estática — no necesita servidor para diseñar pipelines.
-
Clona el repositorio e instala:
Terminal window git clone https://github.com/VictorPasqualini/sparquet.gitcd sparquet/sparquet-studionpm install -
Arráncalo:
Terminal window npm run dev -
Abre http://localhost:5273. El primer arranque crea un Workflow Getting Started con Jobs que funcionan.
Para alojarlo, genera el bundle estático y cópialo donde quieras:
npm run build # → dist/npm run preview # sirve el build en localEl runner local (opcional)
Sección titulada «El runner local (opcional)»Diseñar solo necesita el navegador. Ejecutar desde el lienzo necesita Spark, así que el Studio incluye un pequeño servicio que levantas tú:
cd sparquet-studiopip install -r server/requirements.txtuvicorn server.main:app --port 8787Imprime un token al arrancar; pégalo en Settings → Local runner del Studio. El procedimiento completo está en Ejecutar un Job.
Siguiente
Sección titulada «Siguiente»Escribe tu primer pipeline — cinco minutos, sin Studio.