Ir al contenido
SparquetSparquet

¿Qué es Sparquet?

Sparquet son dos cosas que comparten un archivo.

El framework es una librería de Python que lee un pipeline descrito en JSON y lo ejecuta en Spark: lee una fuente, aplica transformaciones en orden, comprueba reglas de calidad y escribe uno o varios destinos.

Sparquet Studio es una aplicación de navegador que dibuja ese mismo JSON en un lienzo de nodos — y compila el lienzo de vuelta a él.

El documento es el contrato. El framework nunca necesita al Studio para ejecutar un trabajo, y el Studio nunca inventa sintaxis que el framework no soporte.

pedidos_curados.json
{
"name": "pedidos_curados",
"input": {
"format": "delta",
"path": "ventas.pedidos"
},
"transformations": [
{ "type": "filter", "condition": "status = 'CONFIRMADO'" },
{ "type": "with_column", "column": "ingresos", "expression": "cantidad * precio_unitario" }
],
"validations": {
"on_failure": "warn",
"rules": [{ "type": "not_null", "columns": ["id"] }]
},
"output": { "format": "delta", "path": "analytics.pedidos", "mode": "overwrite" }
}
from sparquet import Sparquet
fw = Sparquet()
print(fw.run("pedidos_curados.json").summary())
fw.stop()

Esa es toda la superficie: un archivo y una llamada. Todo lo demás en esta documentación es un campo que puedes añadir a ese archivo.

Revisable

El pipeline es un documento. Cabe en un pull request, se compara limpio entre entornos y no se esconde en el estado de un cuaderno.

Reutilizable

Los marcadores {param} convierten un archivo en muchas ejecuciones — por región, por fecha, por cliente — sin copiar lógica.

Consistente

Lecturas, escrituras, merges y comprobaciones de calidad se comportan igual en cada trabajo, porque son el mismo camino de código.

Visual cuando sirve

El lienzo es un editor del archivo, no un reemplazo. Elimina el Studio y todos los trabajos siguen funcionando.

  • No es un orquestador. Sparquet ejecuta un pipeline. Airflow, Dagster, Databricks Workflows o cron deciden cuándo.
  • No es una plataforma alojada. No hay plano de control y nada llama a casa. Es una librería en tu clúster.
  • No reemplaza a Spark. Es una forma de escribir trabajos de Spark que no tendrás que reescribir. Lo que el framework no expresa, lo cubren la transformación sql y los registros propios.
  1. Instalación — el framework y, opcionalmente, el Studio.

  2. Tu primer pipeline — un trabajo funcionando en cinco minutos, desde la terminal.

  3. Tu primer Job en el Studio — el mismo pipeline, dibujado en el lienzo.

  4. Conceptos — orden de ejecución y cómo el grafo se convierte en el archivo.

  5. Referencia — cada transformación, conector, validador y API, campo a campo.

  6. Guías — recetas de principio a fin: bases de datos, joins con pushdown, calidad de datos, cargas incrementales.