Colibri
Documentação do mini lakehouse do Observatório de Contratações Públicas
Boas-vindas

O Colibri é o mini lakehouse do Observatório de Contratações Públicas: uma plataforma que reúne, modela e disponibiliza bases de dados sobre compras públicas brasileiras em formato tabular, pronto para consulta em SQL e para conexão direta a partir de R ou Python — sem exigir que cada pesquisador reescreva sua própria integração com APIs.
Este book documenta o projeto de ponta a ponta: por que ele existe, o que o seu Produto Minimamente Viável (MVP) entrega, e como instalar, desenvolver e analisar dados nele. É voltado a quatro públicos:
- Pesquisadores, jornalistas e sociedade civil que querem entender o que o Colibri se propõe a resolver e o que podem esperar dele.
- Gestores públicos avaliando por que a infraestrutura de dados de contratações públicas deve ser pensada para o Brasil como um todo, não como uma ferramenta interna de um observatório específico.
- Desenvolvedores que vão contribuir com pipelines e modelos dbt no repositório.
- Analistas e cientistas de dados que vão se conectar ao lakehouse para explorar, consultar e baixar tabelas.
Como este book está organizado
- O Observatório não precisa de um lakehouse — por que essa infraestrutura de dados é uma necessidade do Brasil, não de um observatório específico.
- O que esperar do colibri — data warehouse, data lake, lakehouse, e por que consultar dados públicos via API é uma barreira para estudos replicáveis.
- O Produto Minimamente Viável (MVP) do colibri — o projeto do MVP, suas fontes de dados, arquitetura e parceiros de teste.
- Guia de instalação do colibri — passo a passo para instalar o ambiente no Windows ou no Mac.
- Guia do desenvolvedor do colibri — o ritual de desenvolvimento de pipelines e modelos dbt.
- Guia do analista de dados do colibri — como se conectar ao lakehouse para visualizar, baixar e consultar tabelas.