Pular para o conteúdo
SparquetSparquet

O que é o Sparquet?

O Sparquet é duas coisas que compartilham um arquivo.

O framework é uma biblioteca Python que lê um pipeline descrito em JSON e o executa no Spark: lê uma fonte, aplica transformações em ordem, verifica regras de qualidade e grava um ou mais destinos.

O Sparquet Studio é uma aplicação de navegador que desenha esse mesmo JSON em um canvas de nós — e compila o canvas de volta para ele.

O documento é o contrato. O framework nunca precisa do Studio para rodar um job, e o Studio nunca inventa sintaxe que o framework não suporta.

pedidos_curados.json
{
"name": "pedidos_curados",
"input": {
"format": "delta",
"path": "vendas.pedidos"
},
"transformations": [
{ "type": "filter", "condition": "status = 'CONFIRMADO'" },
{ "type": "with_column", "column": "receita", "expression": "quantidade * preco_unitario" }
],
"validations": {
"on_failure": "warn",
"rules": [{ "type": "not_null", "columns": ["id"] }]
},
"output": { "format": "delta", "path": "analytics.pedidos", "mode": "overwrite" }
}
from sparquet import Sparquet
fw = Sparquet()
print(fw.run("pedidos_curados.json").summary())
fw.stop()

Essa é a superfície inteira: um arquivo e uma chamada. Todo o resto desta documentação é um campo que você pode adicionar a esse arquivo.

Revisável

O pipeline é um documento. Cabe em um pull request, compara limpo entre ambientes e não se esconde no estado de células de um notebook.

Reutilizável

Placeholders {param} transformam um arquivo em muitas execuções — por região, por data, por cliente — sem copiar lógica.

Consistente

Leituras, escritas, merges e checagens de qualidade se comportam igual em todo job, porque são o mesmo caminho de código.

Visual quando ajuda

O canvas é um editor do arquivo, não um substituto. Apague o Studio e todo job continua rodando.

  • Não é um orquestrador. O Sparquet executa um pipeline. Airflow, Dagster, Databricks Workflows ou cron decidem quando.
  • Não é uma plataforma hospedada. Não existe control plane e nada liga para casa. É uma biblioteca no seu cluster.
  • Não substitui o Spark. É um jeito de escrever jobs Spark que você não precisa reescrever. O que o framework não expressa, a transformação sql e os registros customizados cobrem.
  1. Instalação — o framework e, opcionalmente, o Studio.

  2. Seu primeiro pipeline — um job funcionando em cinco minutos, pelo terminal.

  3. Seu primeiro Job no Studio — o mesmo pipeline, desenhado no canvas.

  4. Conceitos — ordem de execução e como o grafo vira o arquivo.

  5. Referência — cada transformação, conector, validador e API, campo a campo.

  6. Guias — receitas ponta a ponta: bancos de dados, joins com pushdown, qualidade de dados, cargas incrementais.