DuckDB-Wasm + Parquet em S3

não configurado

1. Credenciais S3

Ficam salvas só neste navegador (IndexedDB) e são usadas exclusivamente para assinar (SigV4) as requisições feitas diretamente do seu navegador para o S3 — nunca passam por nenhum servidor intermediário. Use as credenciais do usuário IAM dedicado gerado pelo Terraform do protótipo (terraform output aws_access_key_id / aws_secret_access_key), nunca credenciais de administração.


    

2. Consulta não espacial

s3://<bucket>/orders/orders.parquet e agrega receita por categoria.

3. Consulta geoespacial

s3://<bucket>/stores/stores.parquet (geometria em WKB) e roda ST_Transform + ST_Distance (distância até uma matriz em Sao Paulo), ST_Within + ST_Buffer (lojas num raio de 15 km) e ST_ConvexHull + ST_Area (área do polígono que envolve as lojas).

Distância até a matriz

Lojas num raio de 15 km

Área do polígono convexo (km²)

5. Consulta Receita Federal (CNPJ / Nome / CPF)

Dataset público "Dados Abertos do CNPJ" (~222 milhões de linhas, ~7 GB em Parquet), carregado em s3://<bucket>/receita/. O CPF dos sócios pessoa física vem mascarado pela própria Receita Federal (ex.: ***903770**) — só os 6 dígitos centrais são públicos. As tabelas grandes (até ~4 GB) só são abertas na 1ª busca de cada tipo (alguns segundos a mais só na primeira vez); depois disso as buscas escaneiam dezenas de milhões de linhas sem índice, o que também pode levar alguns segundos.

Por CNPJ

Por nome (razão social)

Por CPF (dígitos visíveis)

6. SQL livre

Explore os dois arquivos com qualquer SQL do DuckDB.