Instalação
Requisitos
Seção intitulada “Requisitos”| Python | 3.9 ou superior |
| Java | 11 ou 17 — exigido pelo próprio Spark (JAVA_HOME apontando para ele) |
| PySpark | 3.4 ou superior, instalado como dependência |
| Node.js | 18.18+ — apenas para o Sparquet Studio |
Em plataforma gerenciada (Databricks, EMR, Dataproc, Synapse) Spark e Java já existem; você instala só o framework.
O framework
Seção intitulada “O framework”pip install sparquetgit clone https://github.com/VictorPasqualini/sparquet.gitcd sparquetpip install -e .Adicione sparquet às bibliotecas do cluster, ou instale no notebook:
%pip install sparquetdbutils.library.restartPython()Verifique:
from sparquet import Sparquetprint(Sparquet)Extras opcionais
Seção intitulada “Extras opcionais”| Extra | Instalação | Quando precisa |
|---|---|---|
| Delta Lake (OSS) | pip install "sparquet[delta]" |
Tabelas Delta fora do Databricks |
| Iceberg | pacote Spark no cluster | Tabelas Iceberg |
| Kafka | pacote Spark no cluster | Publicar em um tópico |
Os pacotes de conector são declarados por pipeline, então o job carrega a própria dependência:
{ "spark": { "configs": { "spark.jars.packages": "io.delta:delta-spark_2.12:3.2.0" } }}Sparquet Studio
Seção intitulada “Sparquet Studio”O Studio é uma aplicação estática — não precisa de servidor para desenhar pipelines.
-
Clone o repositório e instale:
Terminal window git clone https://github.com/VictorPasqualini/sparquet.gitcd sparquet/sparquet-studionpm install -
Rode:
Terminal window npm run dev -
Abra http://localhost:5273. A primeira execução cria um Workflow Getting Started com Jobs funcionando.
Para hospedar, gere o bundle estático e copie para onde quiser:
npm run build # → dist/npm run preview # serve o build localmenteO runner local (opcional)
Seção intitulada “O runner local (opcional)”Desenhar precisa só do navegador. Executar pelo canvas precisa de Spark, então o Studio traz um serviço que você mesmo sobe:
cd sparquet-studiopip install -r server/requirements.txtuvicorn server.main:app --port 8787Ele imprime um token na subida; cole em Settings → Local runner no Studio. O procedimento completo está em Executando um Job.
Próximo
Seção intitulada “Próximo”Escreva seu primeiro pipeline — cinco minutos, sem Studio.