Metodologia
🔄 Processo de Coleta
- Identificação de fontes: cada CBM é pesquisado individualmente — portais oficiais, dashboards públicos (Power BI, Metabase, Looker Studio), anuários estatísticos em PDF, boletins operacionais.
- Extração: dados extraídos manualmente com registro da URL, data de captura e metodologia da fonte.
- Transformação: padronização em schema flat: Uf, Cbm, Fonte, Fonte_url, Capturado_em, Ano_base, Categoria, Tipo, Subcategoria, Total.
- Armazenamento: MongoDB, banco cbm_data, 1 collection por UF.
- Catalogação: cada UF tem registro na collection fontes com confiabilidade, período e notas metodológicas.
📊 Classificação de Confiabilidade
| Nível | Critério |
|---|---|
| ⭐⭐⭐⭐ Muito alta | Fonte primária oficial, série longa, granularidade fina, publicada regularmente |
| ⭐⭐⭐ Alta | Fonte primária oficial, série consistente, extração direta |
| ⭐⭐½ Média-alta | Fonte primária oficial com limitações (OCR, KPIs fixos, escopo restrito) |
| ⭐⭐ Média | Fonte oficial parcial ou secundária, período curto, sem atualização recente |
| ⭐½ Baixa-média | Dados fragmentados, fonte secundária com alguma verificação |
| ⭐ Baixa | Dependente majoritariamente de imprensa/fontes terciárias |
⚠️ Regras de Transparência
- Divergências entre fontes são preservadas — nunca reconciliadas artificialmente.
- Métricas INPE (satélite) e CBM (ocorrências atendidas) mantidas em documentos separados.
- Metadados de limitações são registrados na collection fontes, não nas collections por UF.
- Registros de imprensa recebem tipo "estimativa_jornalistica" e confiabilidade reduzida.