Revisável
O pipeline é um documento. Cabe em um pull request, compara limpo entre ambientes e não se esconde no estado de células de um notebook.
O Sparquet é duas coisas que compartilham um arquivo.
O framework é uma biblioteca Python que lê um pipeline descrito em JSON e o executa no Spark: lê uma fonte, aplica transformações em ordem, verifica regras de qualidade e grava um ou mais destinos.
O Sparquet Studio é uma aplicação de navegador que desenha esse mesmo JSON em um canvas de nós — e compila o canvas de volta para ele.
O documento é o contrato. O framework nunca precisa do Studio para rodar um job, e o Studio nunca inventa sintaxe que o framework não suporta.
{ "name": "pedidos_curados", "input": { "format": "delta", "path": "vendas.pedidos" }, "transformations": [ { "type": "filter", "condition": "status = 'CONFIRMADO'" }, { "type": "with_column", "column": "receita", "expression": "quantidade * preco_unitario" } ], "validations": { "on_failure": "warn", "rules": [{ "type": "not_null", "columns": ["id"] }] }, "output": { "format": "delta", "path": "analytics.pedidos", "mode": "overwrite" }}from sparquet import Sparquet
fw = Sparquet()print(fw.run("pedidos_curados.json").summary())fw.stop()Essa é a superfície inteira: um arquivo e uma chamada. Todo o resto desta documentação é um campo que você pode adicionar a esse arquivo.
Revisável
O pipeline é um documento. Cabe em um pull request, compara limpo entre ambientes e não se esconde no estado de células de um notebook.
Reutilizável
Placeholders {param} transformam um arquivo em muitas execuções — por
região, por data, por cliente — sem copiar lógica.
Consistente
Leituras, escritas, merges e checagens de qualidade se comportam igual em todo job, porque são o mesmo caminho de código.
Visual quando ajuda
O canvas é um editor do arquivo, não um substituto. Apague o Studio e todo job continua rodando.
sql e os registros customizados cobrem.Instalação — o framework e, opcionalmente, o Studio.
Seu primeiro pipeline — um job funcionando em cinco minutos, pelo terminal.
Seu primeiro Job no Studio — o mesmo pipeline, desenhado no canvas.
Conceitos — ordem de execução e como o grafo vira o arquivo.
Referência — cada transformação, conector, validador e API, campo a campo.
Guias — receitas ponta a ponta: bancos de dados, joins com pushdown, qualidade de dados, cargas incrementais.