Pular para o conteúdo
SparquetSparquet

Instalação

Python 3.9 ou superior
Java 11 ou 17 — exigido pelo próprio Spark (JAVA_HOME apontando para ele)
PySpark 3.4 ou superior, instalado como dependência
Node.js 18.18+ — apenas para o Sparquet Studio

Em plataforma gerenciada (Databricks, EMR, Dataproc, Synapse) Spark e Java já existem; você instala só o framework.

Terminal window
pip install sparquet

Verifique:

from sparquet import Sparquet
print(Sparquet)
Extra Instalação Quando precisa
Delta Lake (OSS) pip install "sparquet[delta]" Tabelas Delta fora do Databricks
Iceberg pacote Spark no cluster Tabelas Iceberg
Kafka pacote Spark no cluster Publicar em um tópico

Os pacotes de conector são declarados por pipeline, então o job carrega a própria dependência:

{
"spark": {
"configs": {
"spark.jars.packages": "io.delta:delta-spark_2.12:3.2.0"
}
}
}

O Studio é uma aplicação estática — não precisa de servidor para desenhar pipelines.

  1. Clone o repositório e instale:

    Terminal window
    git clone https://github.com/VictorPasqualini/sparquet.git
    cd sparquet/sparquet-studio
    npm install
  2. Rode:

    Terminal window
    npm run dev
  3. Abra http://localhost:5273. A primeira execução cria um Workflow Getting Started com Jobs funcionando.

Para hospedar, gere o bundle estático e copie para onde quiser:

Terminal window
npm run build # → dist/
npm run preview # serve o build localmente

Desenhar precisa só do navegador. Executar pelo canvas precisa de Spark, então o Studio traz um serviço que você mesmo sobe:

Terminal window
cd sparquet-studio
pip install -r server/requirements.txt
uvicorn server.main:app --port 8787

Ele imprime um token na subida; cole em Settings → Local runner no Studio. O procedimento completo está em Executando um Job.

Escreva seu primeiro pipeline — cinco minutos, sem Studio.