
Flávia Gaia
Cientista de Dados Sênior · IA Aplicada
Do dado bruto à IA que as pessoas usam.
- Brasília, DF
- Disponível
- Aceita remoto
Sobre
Cientista de Dados Sênior com 6+ anos levando IA do dado bruto até a produção. Desenvolvo assistentes com fontes verificáveis (RAG), automatizo a leitura de documentos e construo auditorias em escala, sempre com controle humano nas decisões sensíveis. Trabalho com Python, LangChain, LangGraph, CrewAI, Databricks e MLflow em Azure e AWS. MBA em IA e Big Data pela USP e mestranda em Computação Aplicada na UnB. Conheça meus projetos em flaviaga.ia.br.
Experiências
Cientista de Dados Sênior
G4F (alocada no FNDE - Fundo Nacional de Desenvolvimento da Educação) · 10/2025 até Atualmente
Desenhei e coloquei em produção um assistente RAG para atendimento a beneficiários de bolsas e auxílios, cobrindo mais de 20 programas: cada resposta aponta o trecho de origem e, fora do índice, o sistema informa que não sabe. Camada de respostas curadas para temas sensíveis, roteamento por intenção, fallback entre modelos e telemetria de cada interação. Automatizei uma fila de e-mails com RAG: rascunho fundamentado na base normativa, aprovado pelo atendente no próprio Outlook antes do envio (Microsoft Graph, Databricks Apps), com histórico auditável. Text-to-SQL com RAG para consulta de bases financeiras em linguagem natural, eliminando pedidos manuais de relatório. Auditoria distribuída de cerca de 1,2 milhão de registros por ciclo em PySpark, com regras de qualidade e detecção de divergências: revelou cerca de 20% de inconsistências e reduziu o tempo de auditoria em 50%. Estruturação da Medallion Architecture e do ambiente Databricks no Azure. Stack: Python, PySpark, Databricks, LangChain, LangGraph, MLflow, Oracle, Palantir Foundry, Airflow.
Cientista de Dados Sênior
BBTS - Banco do Brasil Tecnologia e Serviços · 09/2025 até 10/2025 (1 mês)
Automatizei a leitura de contratos em PDF e a conformidade do fluxo de pagamento: extração estruturada de cláusulas financeiras com LLMs (LangChain), validação determinística das regras de vencimento, orquestração por agentes (CrewAI) para auditoria e detecção de anomalias, e persistência analítica em Delta Lake para trilha de auditoria. Economia financeira direta ao garantir o pagamento dos contratos na data correta. Stack: Python, PySpark, Databricks Workflows, LLMs, processamento de PDF.
Cientista de Dados Especialista em IA
Compass UOL · 05/2025 até 09/2025 (4 meses)
Assistentes documentais com IA generativa sobre acervo técnico extenso para cliente de Óleo & Gás: retrieval semântico, extração estruturada de PDFs com LLMs e interface de validação que mostra a origem de cada campo antes da aprovação, reduzindo em 70% o tempo de criação de documentos técnicos. Sistemas multiagentes (CrewAI) e pipelines RAG integrados a data lakes corporativos (AWS, Azure, Databricks), com fine-tuning de LLMs para o domínio, versionamento de prompts e métricas com MLflow e rastreamento com LangSmith.
Cientista de Dados Aplicada a IA
EVCOMX · 01/2024 até 05/2025 (1 ano e 4 meses)
Extração de informação e classificação textual em documentos de engenharia, com migração de regex e heurísticas para IA generativa (LangChain e LLMs): melhoria de 80% na identificação e correção de tags técnicas. Interfaces de validação em Streamlit, Human in the Loop com CrewAI e versionamento de prompts e métricas com MLflow. Pipelines de ML e NLP ponta a ponta (preparação, treino, avaliação e deploy) e sistemas de perguntas e respostas com LLMs. Stack: Python, LangChain, BERT, spaCy, scikit-learn, TensorFlow, MLOps.
Analista de Dados
MDS - Ministério do Desenvolvimento e Assistência Social · 08/2023 até 01/2024 (5 meses)
Análise territorial de grandes bases de programas sociais (Cadastro Único, Bolsa Família e BPC) com processamento distribuído em Hadoop e PySpark, Python e SQL. Construção de indicadores, monitoramento e dashboards em Power BI e QlikSense para apoio à decisão em políticas públicas.
Estagiária de Ciência de Dados
Presidência da República · 03/2021 até 05/2022 (1 ano e 2 meses)
NLP aplicado a documentos institucionais e notícias: coleta automatizada via web scraping em Python, reconhecimento de entidades (NER) e sumarização com spaCy. Modelos de classificação e agrupamento com scikit-learn e dashboards em Power BI para apoio à liderança. Projeto de visão computacional com CNN para detecção de COVID-19 em radiografias de tórax.