Tu primer Job en Studio
Studio es un editor para el archivo que escribiste en la guía rápida. Mismo documento, distinto dispositivo de entrada.
-
Abre Studio
Sección titulada «Abre Studio»Terminal window cd sparquet-studionpm installnpm run devVe a http://localhost:5273. El primer inicio crea un Workflow Getting Started con Jobs funcionales — abre uno para explorar, o sigue la guía y construye el tuyo.
-
Crea un Workflow y un Job
Sección titulada «Crea un Workflow y un Job»Un Workflow agrupa Jobs relacionados; uno por dominio mantiene los nombres cortos. Un Job es un JSON de pipeline — el archivo que ejecuta el framework. Haz clic en New workflow, nómbralo
Sales, luego New job dentro de él y llámaloOrders curated.Aterrizas en un lienzo vacío con la paleta de nodos a la izquierda y el inspector a la derecha.
-
Agrega una fuente
Sección titulada «Agrega una fuente»Arrastra CSV desde Sources al lienzo. El inspector se abre a la derecha con los campos que ese formato realmente lee.
Establece Path en
data/orders.csv. Deja las opciones como están —headereinferSchemaya están activos, coincidiendo con los valores por defecto del framework. -
Agrega transformaciones
Sección titulada «Agrega transformaciones»Arrastra Filter al lienzo y conecta el handle derecho del nodo CSV a su handle izquierdo. En el inspector, establece Condition en:
status = 'CONFIRMED'Agrega Cast, With column y Drop duplicates de la misma forma, encadenados de izquierda a derecha. El orden en el lienzo es el orden en el array
transformations. -
Agrega reglas de calidad
Sección titulada «Agrega reglas de calidad»Arrastra Validations al lienzo y conéctalo después de la última transformación. Establece On failure en
warn, luego agrega dos reglas:not_nullsobreid, yuniquesobreid.Las validaciones siempre se ejecutan después de todas las transformaciones principales y antes de cualquier escritura — la posición en el lienzo lo refleja.
-
Agrega un destino
Sección titulada «Agrega un destino»Arrastra Parquet desde Destinations, conecta el nodo de validaciones a él, y establece:
- Path:
out/orders - Write mode:
overwrite - Partition by:
country
- Path:
-
Lee el archivo que acabas de dibujar
Sección titulada «Lee el archivo que acabas de dibujar»Presiona Ctrl/⌘+J.
El panel JSON muestra el pipeline compilado — exactamente el documento que el framework ejecuta. Cópialo, descárgalo o hazle commit junto a tu job. Nada se genera a tus espaldas; lo que ves es lo que se ejecuta.
-
Revisa el linter
Sección titulada «Revisa el linter»Presiona Ctrl/⌘+E para el panel de Issues. Se ejecuta mientras escribes y detecta los errores que Spark solo reporta después de minutos de cómputo: un merge sin claves, una variable de runtime que nada publica, un parámetro que nunca declaraste, una salida escribiendo en una ruta que otra salida ya reclamó.
Haz clic en un issue para saltar al nodo y al campo que lo causó.
-
Ejecútalo
Sección titulada «Ejecútalo»Presiona Ctrl/⌘+Enter para el panel de ejecución. Si el runner local aún no se ha iniciado, el panel muestra los dos comandos que necesitas:
Terminal window cd sparquet-studiopip install -r server/requirements.txtuvicorn server.main:app --port 8787El runner imprime un token — pégalo en el panel. Luego Run ejecuta el JSON compilado con el framework real y devuelve conteos de filas, resultados de validación por regla, una vista previa de 50 filas y los propios logs del framework.
La correspondencia, en una tabla
Sección titulada «La correspondencia, en una tabla»| En el lienzo | En el archivo |
|---|---|
| Nodo de fuente | input |
| Nodos de transformación en la cadena compartida | transformations |
| Nodos de regla de validación | validations.rules (un nodo por regla) |
| Nodo de destino | output / outputs |
| Nodos después de que el grafo se bifurca | las transformations propias de ese destino |
Segundo input de un join / union |
with más with_transformations |
| Nota adhesiva | nada — las anotaciones nunca compilan |
Importa lo que ya tienes
Sección titulada «Importa lo que ya tienes»¿Ya tienes un JSON de pipeline? Abre el panel JSON, cambia a Edit, pega el archivo y haz clic en Apply to canvas. Studio lo distribuye y cada nodo se vuelve editable. Los tipos de transformación desconocidos — los personalizados que registraste tú mismo — se conservan intactos a través del ida y vuelta.
Siguiente
Sección titulada «Siguiente»- El lienzo — conexiones, ramificación, control por teclado.
- Asistente de IA — describe un Job en lugar de dibujarlo.
- Pipelines — encadena varios Jobs en una ejecución secuencial.
- Conceptos fundamentales — qué se ejecuta y cuándo, y por qué el grafo se corresponde como lo hace.