início

Engenharia de dados · Databricks · dados e automação

Pedro Oliveira

Construo projetos de dados em Databricks e registro as decisões, o código e o que acontece quando um agente de código participa do trabalho. Código e experimentos estão publicados em repositórios abertos.

1.01  projeto

Skills para o Genie Code

● em curso  ·  catorze skills em uso

O Genie Code trabalha com skills, instruções que o orientam em domínios específicos. Skills nativas cobrem notebooks, Unity Catalog, dashboards e pipelines, mas não cobrem decisão arquitetural, convenções de nomenclatura nem padrões de revisão.

O agente de código sabe fazer bem o trabalho. Mas quem diz onde salvar, como nomear e o que registrar? Dá para ensinar isso ao agente?

as skills
Catorze, escritas para o que as nativas não cobrem.Cada skill nasceu de um problema prático, uma por vez.
a avaliação
O mesmo trabalho feito duas vezes, com e sem skills.Vinte e quatro sessões, cada uma com transcrição publicada.
o que vem
Reescrever o conjunto depois que os testes fecharem.Sai o que não sustenta o próprio peso, fica o que sustenta.

Skills em Markdown, versionadas em Git, carregadas pelo Genie Code durante as sessões. Versão avaliada congelada por commit.

conhecer o projeto repositório

2.01  projeto

Pipeline de dados da CVM

● em curso  ·  três etapas agendadas

Ingestão e tratamento das Demonstrações Financeiras Padronizadas (DFP) que as companhias abertas entregam à Comissão de Valores Mobiliários (CVM). Dado público e bruto, em pacotes anuais, com formato que muda de um ano para outro.

Como um pipeline que roda sozinho entrega o número certo, se a fonte muda de formato e a companhia republica um valor sem aviso?

arquitetura
Quatro etapas: captura, histórico, tratamento, entrega.Cada etapa faz uma coisa, e nenhuma versão é sobrescrita.
cobertura
Resultado e balanço patrimonial, de 2021 a 2026.Todas as companhias abertas que entregaram DFP no período.
garantias
O que impede um número errado de passar em silêncio.A estrutura é conferida antes da escrita, e o código, testado.

PySpark sobre Delta Lake e Unity Catalog. Ruff e pytest em cada push, ambiente e jobs declarados em Databricks Asset Bundles.

conhecer o projeto repositório

3.01  ferramentas

Stack

plataforma
Databricks, Delta Lake, Unity Catalog, Asset Bundles
engenharia
PySpark, SQL, Python, Git, GitHub Actions, pytest, Ruff
modelagem
Arquitetura medalhão, modelagem dimensional
business intelligence
Power BI, DAX, Power Query (M), Excel, VBA

4.01  trajetória

Experiência

desde 2025
Business Intelligence · BradescoControladoria, na redistribuição gerencial dos custos de TI entre as áreas do banco. Implantação do MyABCM, relatórios em Power Query e Power BI, e construção de pipelines em Databricks.
2023 – 2025
Especialista de dados · act digitalAlocado no cliente Bradesco: dashboards de dados de TI e financeiros em Power BI com M e DAX, automação de rotinas em VBA e preparação de grandes volumes de dados para análise.
2017 – 2023
Analista de planejamento financeiro · Claro BrasilSeis anos, com passagem por administrativo sênior e BI antes do planejamento: orçamento de projeto, revisão de forecast, análise das variações entre orçado e realizado, e reports em Excel e QlikView.
2016
Analista administrativo sênior · WalmartSuporte à implantação do Sistema de Gestão de Perecíveis, com análise e divulgação semanal dos indicadores de adesão das 374 lojas envolvidas no projeto.

5.01  formação

Formação

2019 – 2022
Bacharelado em Administração · Universidade Cruzeiro do Sul
2022
Orçamento e Controle · FGV
2016 – 2017
Técnico em Administração · ETEC
em preparação
Certificação Databricks Data Engineer Associate