
Flávia Gaia
Cientista de Dados Sênior · IA Aplicada
Sobre
Cientista de Dados Sênior com 6+ anos levando IA do dado bruto até a produção. Desenvolvo assistentes com fontes verificáveis (RAG), automatizo a leitura de documentos e construo auditorias em escala, sempre com controle humano nas decisões sensíveis. Trabalho com Python, LangChain, LangGraph, CrewAI, Databricks e MLflow em Azure e AWS. MBA em IA e Big Data pela USP e mestranda em Computação Aplicada na UnB. Conheça meus projetos em flaviaga.ia.br.
Experiências
- 10/2025 até Atualmente
Cientista de Dados Sênior
G4F (alocada no FNDE - Fundo Nacional de Desenvolvimento da Educação)
Desenhei e coloquei em produção um assistente RAG para atendimento a beneficiários de bolsas e auxílios, cobrindo mais de 20 programas: cada resposta aponta o trecho de origem e, fora do índice, o sistema informa que não sabe. Camada de respostas curadas para temas sensíveis, roteamento por intenção, fallback entre modelos e telemetria de cada interação. Automatizei uma fila de e-mails com RAG: rascunho fundamentado na base normativa, aprovado pelo atendente no próprio Outlook antes do envio (Microsoft Graph, Databricks Apps), com histórico auditável. Text-to-SQL com RAG para consulta de bases financeiras em linguagem natural, eliminando pedidos manuais de relatório. Auditoria distribuída de cerca de 1,2 milhão de registros por ciclo em PySpark, com regras de qualidade e detecção de divergências: revelou cerca de 20% de inconsistências e reduziu o tempo de auditoria em 50%. Estruturação da Medallion Architecture e do ambiente Databricks no Azure. Stack: Python, PySpark, Databricks, LangChain, LangGraph, MLflow, Oracle, Palantir Foundry, Airflow.
- 09/2025 até 10/2025 (1 mês)
Cientista de Dados Sênior
BBTS - Banco do Brasil Tecnologia e Serviços
Automatizei a leitura de contratos em PDF e a conformidade do fluxo de pagamento: extração estruturada de cláusulas financeiras com LLMs (LangChain), validação determinística das regras de vencimento, orquestração por agentes (CrewAI) para auditoria e detecção de anomalias, e persistência analítica em Delta Lake para trilha de auditoria. Economia financeira direta ao garantir o pagamento dos contratos na data correta. Stack: Python, PySpark, Databricks Workflows, LLMs, processamento de PDF.
- 05/2025 até 09/2025 (4 meses)
Cientista de Dados Especialista em IA
Compass UOL
Assistentes documentais com IA generativa sobre acervo técnico extenso para cliente de Óleo & Gás: retrieval semântico, extração estruturada de PDFs com LLMs e interface de validação que mostra a origem de cada campo antes da aprovação, reduzindo em 70% o tempo de criação de documentos técnicos. Sistemas multiagentes (CrewAI) e pipelines RAG integrados a data lakes corporativos (AWS, Azure, Databricks), com fine-tuning de LLMs para o domínio, versionamento de prompts e métricas com MLflow e rastreamento com LangSmith.
- 01/2024 até 05/2025 (1 ano e 4 meses)
Cientista de Dados Aplicada a IA
EVCOMX
Extração de informação e classificação textual em documentos de engenharia, com migração de regex e heurísticas para IA generativa (LangChain e LLMs): melhoria de 80% na identificação e correção de tags técnicas. Interfaces de validação em Streamlit, Human in the Loop com CrewAI e versionamento de prompts e métricas com MLflow. Pipelines de ML e NLP ponta a ponta (preparação, treino, avaliação e deploy) e sistemas de perguntas e respostas com LLMs. Stack: Python, LangChain, BERT, spaCy, scikit-learn, TensorFlow, MLOps.
- 08/2023 até 01/2024 (5 meses)
Analista de Dados
MDS - Ministério do Desenvolvimento e Assistência Social
Análise territorial de grandes bases de programas sociais (Cadastro Único, Bolsa Família e BPC) com processamento distribuído em Hadoop e PySpark, Python e SQL. Construção de indicadores, monitoramento e dashboards em Power BI e QlikSense para apoio à decisão em políticas públicas.
- 03/2021 até 05/2022 (1 ano e 2 meses)
Estagiária de Ciência de Dados
Presidência da República
NLP aplicado a documentos institucionais e notícias: coleta automatizada via web scraping em Python, reconhecimento de entidades (NER) e sumarização com spaCy. Modelos de classificação e agrupamento com scikit-learn e dashboards em Power BI para apoio à liderança. Projeto de visão computacional com CNN para detecção de COVID-19 em radiografias de tórax.
Formação
Mestrado em Computação Aplicada
Universidade de Brasília
Início em 2024 · Mestrado - Em andamento
Bacharelado em Ciência de Dados e Inteligência Artificial
IESB
2019 até 2023 · Ensino Superior - Completo
MBA em Inteligência Artificial e Big Data
Universidade de São Paulo
2022 até 2023 · MBA - Completo
Idiomas
- Português Brasil Nativo
- Inglês Básico
Habilidades
Perfil comportamental
Perfil: Orientado a Resultados
O Orientado a Resultados é confiante, competitivo e focado em desafios, está sempre procurando novas oportunidades para testar e desenvolver suas habilidades e capacidade de entrega.
Avaliação DISC feita no Recrutest
Perfil completo, com vídeo e mais detalhes: recrutei.me/s6zkjrkb