Metodologia

🔄 Processo de Coleta

  1. Identificação de fontes: cada CBM é pesquisado individualmente — portais oficiais, dashboards públicos (Power BI, Metabase, Looker Studio), anuários estatísticos em PDF, boletins operacionais.
  2. Extração: dados extraídos manualmente com registro da URL, data de captura e metodologia da fonte.
  3. Transformação: padronização em schema flat: Uf, Cbm, Fonte, Fonte_url, Capturado_em, Ano_base, Categoria, Tipo, Subcategoria, Total.
  4. Armazenamento: MongoDB, banco cbm_data, 1 collection por UF.
  5. Catalogação: cada UF tem registro na collection fontes com confiabilidade, período e notas metodológicas.

📊 Classificação de Confiabilidade

NívelCritério
⭐⭐⭐⭐ Muito altaFonte primária oficial, série longa, granularidade fina, publicada regularmente
⭐⭐⭐ AltaFonte primária oficial, série consistente, extração direta
⭐⭐½ Média-altaFonte primária oficial com limitações (OCR, KPIs fixos, escopo restrito)
⭐⭐ MédiaFonte oficial parcial ou secundária, período curto, sem atualização recente
⭐½ Baixa-médiaDados fragmentados, fonte secundária com alguma verificação
⭐ BaixaDependente majoritariamente de imprensa/fontes terciárias

⚠️ Regras de Transparência

  • Divergências entre fontes são preservadas — nunca reconciliadas artificialmente.
  • Métricas INPE (satélite) e CBM (ocorrências atendidas) mantidas em documentos separados.
  • Metadados de limitações são registrados na collection fontes, não nas collections por UF.
  • Registros de imprensa recebem tipo "estimativa_jornalistica" e confiabilidade reduzida.