Ir al contenido
SparquetSparquet

Tu primer Job en Studio

Studio es un editor para el archivo que escribiste en la guía rápida. Mismo documento, distinto dispositivo de entrada.

  1. Terminal window
    cd sparquet-studio
    npm install
    npm run dev

    Ve a http://localhost:5273. El primer inicio crea un Workflow Getting Started con Jobs funcionales — abre uno para explorar, o sigue la guía y construye el tuyo.

  2. Un Workflow agrupa Jobs relacionados; uno por dominio mantiene los nombres cortos. Un Job es un JSON de pipeline — el archivo que ejecuta el framework. Haz clic en New workflow, nómbralo Sales, luego New job dentro de él y llámalo Orders curated.

    Aterrizas en un lienzo vacío con la paleta de nodos a la izquierda y el inspector a la derecha.

  3. Arrastra CSV desde Sources al lienzo. El inspector se abre a la derecha con los campos que ese formato realmente lee.

    Establece Path en data/orders.csv. Deja las opciones como están — header e inferSchema ya están activos, coincidiendo con los valores por defecto del framework.

  4. Arrastra Filter al lienzo y conecta el handle derecho del nodo CSV a su handle izquierdo. En el inspector, establece Condition en:

    status = 'CONFIRMED'

    Agrega Cast, With column y Drop duplicates de la misma forma, encadenados de izquierda a derecha. El orden en el lienzo es el orden en el array transformations.

  5. Arrastra Validations al lienzo y conéctalo después de la última transformación. Establece On failure en warn, luego agrega dos reglas: not_null sobre id, y unique sobre id.

    Las validaciones siempre se ejecutan después de todas las transformaciones principales y antes de cualquier escritura — la posición en el lienzo lo refleja.

  6. Arrastra Parquet desde Destinations, conecta el nodo de validaciones a él, y establece:

    • Path: out/orders
    • Write mode: overwrite
    • Partition by: country
  7. Presiona Ctrl/⌘+J.

    El panel JSON muestra el pipeline compilado — exactamente el documento que el framework ejecuta. Cópialo, descárgalo o hazle commit junto a tu job. Nada se genera a tus espaldas; lo que ves es lo que se ejecuta.

  8. Presiona Ctrl/⌘+E para el panel de Issues. Se ejecuta mientras escribes y detecta los errores que Spark solo reporta después de minutos de cómputo: un merge sin claves, una variable de runtime que nada publica, un parámetro que nunca declaraste, una salida escribiendo en una ruta que otra salida ya reclamó.

    Haz clic en un issue para saltar al nodo y al campo que lo causó.

  9. Presiona Ctrl/⌘+Enter para el panel de ejecución. Si el runner local aún no se ha iniciado, el panel muestra los dos comandos que necesitas:

    Terminal window
    cd sparquet-studio
    pip install -r server/requirements.txt
    uvicorn server.main:app --port 8787

    El runner imprime un token — pégalo en el panel. Luego Run ejecuta el JSON compilado con el framework real y devuelve conteos de filas, resultados de validación por regla, una vista previa de 50 filas y los propios logs del framework.

En el lienzo En el archivo
Nodo de fuente input
Nodos de transformación en la cadena compartida transformations
Nodos de regla de validación validations.rules (un nodo por regla)
Nodo de destino output / outputs
Nodos después de que el grafo se bifurca las transformations propias de ese destino
Segundo input de un join / union with más with_transformations
Nota adhesiva nada — las anotaciones nunca compilan

¿Ya tienes un JSON de pipeline? Abre el panel JSON, cambia a Edit, pega el archivo y haz clic en Apply to canvas. Studio lo distribuye y cada nodo se vuelve editable. Los tipos de transformación desconocidos — los personalizados que registraste tú mismo — se conservan intactos a través del ida y vuelta.

  • El lienzo — conexiones, ramificación, control por teclado.
  • Asistente de IA — describe un Job en lugar de dibujarlo.
  • Pipelines — encadena varios Jobs en una ejecución secuencial.
  • Conceptos fundamentales — qué se ejecuta y cuándo, y por qué el grafo se corresponde como lo hace.