Yabe, Maria Josefa SantosKroetz, Barbara Lunardelli2026-08-192026-08-192025-03-28https://repositorio.uel.br/handle/123456789/19474Em 05 de novembro de 2015, a barragem de mineração do Fundão, em Mariana (MG), rompeu e liberou aproximadamente 50 milhões de m3 de resíduo de mineração. O resíduo afetou severamente toda a bacia hidrográfica do Rio Doce, atingindo a foz no Oceano Atlântico. Os impactos causados pelo desastre têm sido agravados pela supressão da mata ciliar para o desenvolvimento da agropecuária e pela construção de edifícios comerciais e residenciais. Além disso, a falta de um sistema de saneamento básico tem agravado a situação, devido à interação da matéria orgânica dos efluentes com elementos potencialmente tóxicos, que são mobilizados ao longo da bacia. Barragens de contenção de resíduo da mineração, principalmente as construídas pelo método a montante, apresentam risco para a região, uma vez que podem se romper. Para minimizar os problemas na bacia e buscando recuperar a região, o presente estudo tem como objetivo desenvolver uma metodologia baseada em aprendizagem por reforço (Q-Learning), aplicada à bacia hidrográfica do Rio Doce, para o desenvolvimento de políticas públicas de recuperação ambiental, remediação e fiscalização. Para a aplicação do algoritmo Q-Learning, foi realizado um levantamento de dados sobre as condições socioeconômicas das cidades na bacia do Rio Doce. Os diagramas estado-ação para os parâmetros de desmatamento, mineração e saneamento básico foram estabelecidos em tabelas Q de 6×6, totalizando 36 estados para cada um dos problemas de aprendizagem identificados. O diagrama estado-ação para a concentração dos elementos potencialmente tóxicos na bacia foi estabelecido em tabela Q de 8×8, totalizando 64 estados. O algoritmo estabeleceu o melhor caminho após 1.000 iterações de aprendizagem para atingir a recuperação que leva o agente a receber a maior recompensa acumulada em longo prazo, partindo do estado de maior degradação (S1,1) até o estado de equilíbrio (S6,6 ou S8,8), com base nas maiores porcentagem de recuperação para os parâmetros analisados. A política pública foi estabelecida após a aplicação do algoritmo de aprendizagem por reforço em um sistema de multas e recompensas, objetivando oferecer ao agente o conjunto de ações que maximiza o retorno de longo prazo. O sistema foi baseado no que é previsto em lei e de acordo com as porcentagens de recuperação atingidas pelo agente após a etapa de amostragem e de avaliação. O algoritmo foi eficaz para estabelecer as melhores ações para a recuperação da mata ciliar do Rio Doce, para a descaracterização das barragens de mineração construídas pelo método a montante, bem como para a estruturação de um sistema de saneamento básico, e para a remediação de elementos potencialmente tóxicos nos compartimentos ambientais da bacia. Assim, a política pública para a recuperação eficiente e factível da bacia hidrográfica do Rio Doce pode ser aplicada, proporcionando melhores condições ambientais de longo termo para a região impactadaporAprendizado de máquinaMineraçãoRecuperação ambientalPolítica públicaQuímicaQ-learningMinas e recursos mineraisAprendizagem por reforço (Q-Learning) aplicada à bacia hidrográfica do Rio Doce para o estabelecimento de políticas públicas de recuperaçãoReinforcement learning (Q-Learning) applied to the Doce River basin for establishment of public recovery policiesTeseCiências Exatas e da Terra - QuímicaCiências Exatas e da Terra - QuímicaMachine learningMiningEnvironmental recoveryPublic policyChemistryQ-learningMines and mineral resources