Voltar aos projetos
Modelos Preditivos

Predição de abandono em cursos da UNA-SUS

Modelo CatBoost para estimar risco de abandono em cursos de formação em saúde e apoiar ações de retenção baseadas em dados.

PythonCatBoostMachine LearningEducação em SaúdeUNA-SUSRetenção

Contexto do projeto

O projeto partiu de uma necessidade prática: entender e reduzir a evasão em cursos de formação em saúde da UNA-SUS. Antes da modelagem, foi feito o entendimento do processo educacional, desde a criação do curso, oferta, matrícula, início, finalização e classificação do aluno como aprovado, abandonado, em processo administrativo ou ainda apto a finalizar.

Problema enfrentado

A evasão reduz o impacto das ações formativas, dificulta a gestão de políticas públicas de qualificação profissional e limita o uso estratégico dos recursos educacionais. O desafio era identificar, com antecedência, alunos com maior risco de abandono para orientar ações de contato ativo, tutoria, reforço de comunicação e possível flexibilização de prazos.

Abordagem metodológica

A análise foi estruturada seguindo uma lógica de projeto de dados baseada no CRISP-DM: - Entendimento do negócio - Entendimento dos dados - Preparação dos dados - Modelagem - Avaliação - Implantação O trabalho incluiu desenho de processo, definição dos critérios de finalização, investigação data driven dos cursos de Dengue, preparação das bases, seleção de variáveis, treinamento do modelo, avaliação por métricas e implantação em app.

Situação

Cursos de formação em saúde da UNA-SUS precisavam identificar sinais de evasão antes do abandono, em um processo com grande volume de matrículas, diferentes tempos de curso e múltiplos status de finalização.

Tarefa

Estruturar uma análise preditiva capaz de estimar probabilidade de conclusão e risco de abandono, apoiando ações de tutoria, retenção e acompanhamento.

Ação

Mapeei o processo educacional, defini regras de finalização, investiguei dados de cursos de Dengue, treinei um modelo CatBoost com 9 variáveis e avaliei desempenho por ROC, PR, matriz de confusão, limiares e SHAP.

Resultado

O modelo alcançou AUC ROC de 0,778, AP de 0,84 e acurácia de 0,714, sendo implantado em app para predição individual e em lote.

Métricas principais

AUC ROC
0,778
Precisão média
0,84
Acurácia
0,714
Prevalência (conclusão)
0,660
Nº de variáveis
9
CatBoost
1.2.8
Limiar manual
0,50
Limiar Youden
0,656
Registros avaliados
219.561

Entendimento do processo

O projeto começou pelo mapeamento do fluxo educacional. Foram considerados diferentes níveis temporais: criação do curso, oferta, período de matrícula, início da aula, fim da aula, ingresso do aluno e data de finalização. Esse entendimento foi necessário para diferenciar alunos aprovados, abandonados, em processo administrativo e alunos que ainda poderiam finalizar o curso.

Investigação data driven

A investigação inicial focou em cursos de Dengue e organizou o fluxo dos alunos entre matrícula, conclusão, aprovação, abandono, processo administrativo e situação ainda passível de finalização. Essa etapa permitiu transformar um problema educacional amplo em uma pergunta preditiva operacional: quais alunos têm maior risco de abandonar o curso?

Solução proposta

Foi desenvolvido um classificador CatBoost para estimar a probabilidade de conclusão do curso. O risco de abandono é interpretado como o complemento dessa probabilidade, isto é, 1 menos a probabilidade de conclusão. A aplicação permite avaliar o desempenho do modelo, ajustar limiares operacionais e interpretar os fatores associados às predições.

Por que CatBoost

O CatBoost foi escolhido por lidar bem com dados tabulares reais, variáveis categóricas e bases desbalanceadas. Ele combina múltiplas árvores de decisão de forma sequencial, corrigindo erros ao longo do treinamento, e reduz a necessidade de transformar artificialmente categorias em múltiplas colunas.

Variáveis finais do modelo

O modelo final utilizou 9 variáveis: - status_formulario_inicial - matricula_ingresso_inicio_dias - aluno_profissional_profissao_descricao - hist_12m_conclusoes - hist_total_conclusoes - hist_total_abandonos - form_inicial_atual_q03_nivel_conhecimento - aluno_acesso_acesso_uf - aluno_profissional_escolaridade_descricao

Relatório de classificação

No limiar de 0,50, o modelo apresentou: Classe 0, abandono: - Precision: 0,606 - Recall: 0,453 - F1-score: 0,518 - Support: 74.668 Classe 1, conclusão: - Precision: 0,750 - Recall: 0,848 - F1-score: 0,796 - Support: 144.893 Total: - Accuracy: 0,714 - Macro F1: 0,657 - Weighted F1: 0,702 - Support total: 219.561

Interpretação dos limiares

O modelo não entrega uma resposta automática "vai concluir" ou "vai abandonar". Ele entrega uma probabilidade. O limiar operacional deve ser definido conforme a estratégia da equipe: - Limiar mais baixo: aumenta a sensibilidade e captura mais alunos em risco, útil quando o custo de perder um aluno é alto. - Limiar mais alto: aumenta a precisão e concentra as ações em grupos de maior risco, útil quando tutores, bolsas ou recursos de acompanhamento são limitados. - O limiar sugerido por Youden foi 0,656, mas o limiar final deve ser escolhido conforme a capacidade operacional da equipe.

Explicabilidade

A interpretação do modelo foi feita com importância global das variáveis e valores SHAP. Os valores de SHAP ajudam a entender como cada variável empurra a predição para maior chance de conclusão ou maior risco de abandono. No material técnico, por exemplo, mais dias desde o início da matrícula aparece associado a maior risco de abandono, enquanto responder ao formulário inicial aumenta a chance de conclusão.

Implantação

A solução foi implantada em Streamlit, com funcionalidades para: - Predição individual de um aluno - Predição em lote para múltiplos alunos - Avaliação de desempenho do modelo - Ajuste de limiar operacional - Visualização de curvas ROC e Precision-Recall - Matriz de confusão - Relatório de classificação - Análise de importância das variáveis - Análise SHAP

Sobre a métrica Precisão média

A precisão média resume o desempenho do modelo na curva Precision-Recall, sendo útil em problemas com classes desbalanceadas.

Entregáveis

- Aplicação web interativa - Modelo CatBoost treinado - Pipeline de preparação e seleção de variáveis - Relatório técnico de desempenho - Análise de limiar operacional - Curvas ROC e Precision-Recall - Matriz de confusão - Relatório de classificação - Análise de importância das variáveis - Análise SHAP - Apresentação técnica do projeto

Aprendizados

- Projetos preditivos precisam começar pelo entendimento do processo, não pelo modelo. - A definição de abandono depende de regras operacionais claras. - A escolha do limiar é tão importante quanto a métrica global do modelo. - Em bases desbalanceadas, AP, PR curve e análise por classe são essenciais. - SHAP ajuda a transformar o modelo em ferramenta de gestão. - O modelo deve apoiar priorização, não substituir decisão humana.

Links externos