Arthur Reis Engenheiro de Dados e IA
Microsoft Fabric · Databricks · Azure
Engenheiro de Dados e IA especializado em Microsoft Fabric, Databricks e Azure. Construo plataformas de dados modernas, arquiteturas lakehouse, pipelines de alta performance e frameworks de qualidade de dados, e exploro IA aplicada com sistemas multi-agente. Compartilho o que aprendo em palestras, vídeos no Youtube, blogs, no LinkedIn e em projetos open source.
Quem é Arthur
Engenheiro de Dados e IA especializado em Microsoft Fabric, Databricks e Azure. Construo plataformas de dados modernas, arquiteturas lakehouse, pipelines de alta performance e frameworks de qualidade de dados, e exploro IA aplicada com sistemas multi-agente. Compartilho o que aprendo em palestras, vídeos no Youtube, blogs, no LinkedIn e em projetos open source.
- Engenharia de Dados
- SQL & Spark
- Qualidade & Governança
- IA & Agentes
Ferramentas & tecnologias
Engenharia de Dados
SQL & Spark
Qualidade & Governança
IA & Agentes
Experiência
- set. de 2025 — Atual
Engenheiro de Dados · Power Tuning
Brasil · RemotoEstratégia e modernização de plataformas de dados nacionais e internacionais com Microsoft Fabric e Databricks.
- Design e deploy de Data Platform para multinacional brasileira usando Microsoft Fabric e Databricks, alinhando soluções técnicas a objetivos de negócio e governança.
- Arquitetura e deploy de workflows de dados via Infrastructure as Code (IaC) com Azure Data Factory, garantindo pipelines escaláveis, mantíveis e auditáveis.
- Design e implementação de Lakehouse completo e produtos de IA usando Databricks e Azure.
- Implementação de Databricks Genie Spaces como interface de analytics conversacional sobre os dados da plataforma.
Microsoft Fabric Databricks Azure Azure Data Factory PySpark SQL Python - mai. de 2025 — set. de 2025
Engenheiro de Dados · Kumulus
Brasil · RemotoEstratégia de dados, design de plataformas e implementação para clientes nacionais e internacionais.
- Liderança de estratégia de plataforma de dados e design de arquitetura Lakehouse para multinacional americana, definindo padrões de governança, modelos de dados e estrutura alinhada aos objetivos do cliente.
- Contribuição à modernização de plataforma de dados para organização governamental dos EUA, mapeando maturidade de dados e conduzindo adoção junto a stakeholders internacionais.
- Design e implementação de soluções Lakehouse para duas empresas brasileiras, incluindo frameworks de governança e controles de qualidade de dados.
- Mentoria e supervisão de Engenheiros de Dados Júnior, contribuindo para a definição de topologia de equipe.
- Implantação de Microsoft Copilot para aumentar a produtividade das equipes de dados nos clientes.
Databricks Azure Python SQL Delta Lake - abr. de 2024 — mai. de 2025
Engenheiro de Dados · Paytime
Brasil · RemotoResponsável pela estratégia de dados end-to-end da empresa, do zero: infraestrutura, governança, qualidade e analytics.
- Design e implementação do Data Lakehouse (Databricks, Spark, SQL, MongoDB, AWS) como base para produtos de dados e analytics self-service.
- Estabelecimento de práticas de governança: pipelines de testes de qualidade, padrões de documentação e políticas de controle de acesso.
- Design e entrega dos primeiros produtos de dados da empresa: dashboards interativos em Power BI para stakeholders de negócio.
- Implementação de serviços de dados na AWS (S3, Lambda, Glue, IAM) para infraestrutura segura e escalável.
- Exploração e implementação de Databricks Genie Spaces para analytics conversacional sobre os dados da empresa.
Databricks Apache Spark AWS MongoDB Power BI Python SQL - set. de 2023 — mar. de 2024
Analista de Dados · Piwi
Brasil · RemotoGestão da estratégia de dados end-to-end da empresa, da ingestão ao analytics.
- Liderança do desenvolvimento do Lakehouse da empresa no GCP, definindo a estratégia de arquitetura e gestão escalável de dados.
- Design e lançamento dos primeiros produtos de analytics com Looker Studio, habilitando BI self-service.
- Desenvolvimento de pipelines de extração e limpeza de dados em Python, SQL e MongoDB.
GCP Python SQL MongoDB Looker Studio - mar. de 2022 — jan. de 2023
Analista de Dados · Secretaria Estadual de Educação do ES
Espírito Santo · BrasilSuporte a decisões baseadas em dados para políticas educacionais públicas no Espírito Santo.
- Análise de dados e relatórios estratégicos sobre escolas indígenas, quilombolas e rurais para subsidiar decisões de política educacional.
- Produção de materiais educativos e condução de treinamentos sobre práticas de dados para equipes escolares.
Power BI Python SQL Excel - mar. de 2018 — nov. de 2022
Pesquisador / Analista de Dados · UFES — Universidade Federal do Espírito Santo
Vitória, ES · BrasilPesquisa de mestrado e doutorado com foco em análise histórica de dados e modelagem de redes sociais.
- ETL em documentos históricos e construção de pipelines de dados com Python.
- Análise de redes sociais (Twitter) via integração com API usando Python.
- Visualizações e dashboards em Power BI para comunicar resultados a stakeholders acadêmicos.
- Desenvolvimento do site www.jornaisdaindependencia.com.br.
Python R Power BI SQL Excel
Projetos em destaque
Projetos profissionais e pessoais
data-agents-copilot
Sistema de despacho automático que roteia tarefas de dados (SQL, PySpark, pipelines, governança) para 15 agentes IA especializados. Executado via CLI, Chainlit web, ou diretamente no VS Code Chat.
Fork do projeto original data-agents de Thomaz Rossito — adaptado para operar com GitHub Copilot Chat API, adicionando governança automática de nomenclatura, workflows colaborativos multi-agente, Knowledge Base estruturada, sistema de memória episódica e protocolo QA peer-to-peer.
Databricks Platform Refactoring & Optimization
Projeto de refactoring e otimização de uma plataforma de dados baseada em Databricks, com foco em performance, manutenibilidade e cumprimento de SLA crítico de 15 minutos. Após redesign completo do framework e otimizações em PySpark, SQL e arquitetura, a solução atingiu o SLA e se tornou mais escalável, estável e fácil de manter.
Otimização de ETL no Databricks
Otimização de pipelines ETL críticos no Databricks aplicando BroadcastJoin, CLUSTER BY, OPTIMIZE e leitura incremental. Os pipelines passaram por reduções de até 94% no tempo de execução, com impacto direto no consumo de DBU e nas janelas de processamento.
Lakehouse no Azure
Concepção e implementação de um Lakehouse corporativo para grande empresa brasileira com arquitetura medalhão (Bronze, Silver e Gold), integrando múltiplas fontes com destaque para o ERP Protheus. Workspaces segregados por domínio de negócio integrados a um workspace central de Engenharia. Cargas orquestradas via Azure Data Factory com pipelines parametrizados e controlados por SLA.
App Modernization
Migração completa de Data Warehouse On-Premise para arquitetura Lakehouse no Microsoft Fabric: modelagem dimensional, pipelines de ingestão e transformação, migração de procedures SQL para Lakehouse e publicação de relatórios em Power BI com conexão ao Lakehouse.
Stack: Microsoft Fabric, OneLake, Data Factory, PySpark, Synapse Data Warehouse, Power BI, T-SQL, Delta Lake.
Implementação e testes de IA
Integração dos dados da empresa com a IA do Databricks (Genie) para acelerar processos e fomentar a cultura Data-Driven. Realização de testes e difusão da utilização da ferramenta em toda a empresa.
Migração de dados do MongoDB para o Databricks
Migração de banco de dados MongoDB para Databricks utilizando MongoDB Data Federation, AWS S3 e rotinas de carga incremental com Spark. O resultado foi uma rotina regular de atualização dos dados mais robustos da empresa, inclusive transações com milhões de linhas.
Desenvolvimento do Lakehouse
Implementação de um Lakehouse no Databricks integrando toda a base de dados de uma Fintech com SQL, Spark, Databricks e AWS. O resultado foi o aumento de performance nas análises e na atualização de relatórios e painéis.
Portal de Dashboards
Criação de Portal de Dashboards que reduziu o custo de licenças Power BI de R$ 45/licença para R$ 5/licença. A redução de custos e a potência da plataforma levaram à extensão do Portal para mais de 500 clientes da empresa, transformando-o em um produto de dados.
Definição de gêneros usando IA
Classificação automática de gênero em banco de dados legado usando a biblioteca gender_guesser.detector do Python. O resultado foi o preenchimento da tabela com assertividade de aproximadamente 87% (calculada a partir de corpus reduzido).
Repositórios
Código público no GitHub
data-agents-copilot
Sistema multi-agente para engenharia de dados com 15 agentes especializados, memória episódica e servidores MCP.
dqx_framework
Framework de qualidade de dados com Databricks DQX.
fabric-documenter
Documentação automática de notebooks e medidas DAX do Microsoft Fabric via API.
great_expectations_framework
Validação de dados e contratos com Great Expectations.
auto_comments_columns_databricks
Geração automática de descrições de colunas de tabelas no Databricks.
snowflake_cortex
Exploração de GenAI e análise de dados com Snowflake Cortex.
Palestras & eventos
Qualidade de Dados no Databricks
Frameworks de qualidade de dados, contratos de dados, métricas e anti-patterns — ISO-25012 e DAMA DMBOK aplicados na arquitetura medallion.
Arquiteturas modernas de dados: Snowflake, Databricks e um pouco de IA
Comparativo entre arquiteturas modernas de dados — Snowflake e Databricks — e como a IA está transformando a forma de construir e operar plataformas de dados.
Certificações
Databricks Certified Data Engineer Associate
Databricks VerificarApache Spark Developer
Databricks VerificarDatabricks Certified Data Analyst Associate
Databricks VerificarDP-750: Microsoft Fabric Analytics Engineer
Microsoft VerificarDP-700: Microsoft Fabric Data Engineer
Microsoft VerificarDP-900: Azure Data Fundamentals
Microsoft VerificarAZ-900: Azure Fundamentals
Microsoft VerificarAI-900: Microsoft Azure AI Fundamentals
Microsoft VerificarGCP Associate Cloud Engineer
Google VerificarApache Airflow
Astronomer VerificarMongoDB for SQL Professionals
MongoDBGoogle Data Analytics
Google / Coursera VerificarGoogle Project Management
Google / Coursera VerificarVamos conversar
Aberto a projetos, palestras e trocas técnicas.