LAW.co
IA jurídica

RAG jurídico: o que funcionou, o que não funcionou e por quê

Projeto aberto de pesquisa em linguagem natural sobre STF, STJ e legislação — e, mais útil que o resultado, o relato honesto dos becos sem saída: quatro tentativas que não deram certo e o que ficou no lugar.

Equipe IDEIA··7 min de leitura
RAG jurídico: o que funcionou, o que não funcionou e por quê

Todo projeto de IA jurídica tem uma parte que ninguém publica: as tentativas que não deram certo. O RAG Jurídico BR fez o contrário — construiu um sistema de pesquisa em linguagem natural sobre documentos reais do STF, do STJ e da legislação brasileira e documentou os becos sem saída com o motivo de cada um.

Para quem está decidindo se monta busca inteligente no escritório, esse relato vale mais do que a demonstração. Ele mostra onde o dinheiro e o tempo costumam ser perdidos.

Como o projeto funciona

São dois caminhos separados, e entender essa separação é o primeiro passo de qualquer projeto sério de recuperação de informação.

  1. Indexação, que roda uma vez: os documentos entram, o texto é extraído com seus metadados, o conteúdo é dividido em blocos e cada bloco vira um vetor, guardado em um índice local.
  2. Consulta, que roda a cada pergunta: a pergunta também vira vetor, o sistema busca os blocos mais parecidos, monta o contexto com as referências e só então gera a resposta.
  3. A resposta sai citando de onde veio, e a geração de texto é opcional — sem ela, o sistema já devolve os trechos mais relevantes.
A frase que resume o problema

Um advogado não pode usar a IA disse que como argumento. Com recuperação, cada resposta aponta qual lei, qual artigo e qual página — e é essa rastreabilidade que separa assistente de pesquisa de gerador de texto bonito.

As quatro tentativas que não deram certo

Esta é a parte mais valiosa do projeto, e ela está escrita no próprio texto de apresentação.

1. Dividir o texto por parágrafo

A ideia era preservar parágrafos naturais. O problema: PDF jurídico extraído perde a formatação original, e um acórdão de 40 páginas chega como um texto contínuo — os blocos saíam com cinco palavras ou com duas mil, e a sobreposição entre eles ficava inconsistente. O que ficou no lugar: divisão por contagem de palavras, com sobreposição fixa. Menos elegante, muito mais robusto para qualquer documento.

2. Usar um modelo de vetor genérico

A tentativa foi usar um modelo de vetor de uso geral, com bom desempenho em vários idiomas. O resultado: expressões jurídicas brasileiras — tutela antecipada, mandado de segurança, habeas data, precatório — não ficavam bem representadas. O que ficou no lugar: um modelo treinado em português brasileiro, com base jurídica, que roda localmente e não tem custo por consulta.

3. Começar pelo banco vetorial mais amigável

O banco vetorial escolhido inicialmente tinha persistência automática e API mais simpática, mas acrescentava alguns segundos de espera a cada consulta na interface. Para demonstração e uso individual, o índice local com leitura imediata era mais rápido. O que ficou no lugar: o índice local como padrão, e o outro caminho disponível por configuração.

4. Blocos sem sobreposição

Sem sobreposição, a pergunta cujo trecho relevante ficava na virada de um bloco não encontrava resposta: o contexto estava cortado na borda. Ao adicionar sobreposição, o ganho percebido nos testes com perguntas sobre artigos da Constituição foi grande — na ordem de um terço a mais de acerto.

A separação que sustenta tudo

O projeto decide usar dois modelos com funções diferentes: um para entender e representar o texto em português jurídico, outro para raciocinar e escrever a resposta. É uma escolha de arquitetura, não de preferência — forçar o mesmo modelo a fazer as duas coisas piora as duas.

  • Recuperar é encontrar o trecho certo no acervo do escritório.
  • Gerar é escrever a resposta a partir do que foi recuperado.
  • Sem a primeira etapa bem feita, a segunda só produz texto convincente.

Por que isso interessa ao escritório

  • Pesquisa em linguagem natural sobre o material que o escritório escolheu indexar.
  • Resposta limitada aos documentos reais, com citação de documento e página.
  • Controle sobre o que entra no acervo — e, portanto, sobre a atualização.
  • Modelo de vetor rodando localmente, sem custo por consulta e sem mandar o documento para fora.
  • Aprendizado rápido: o projeto foi feito com fins educacionais e de pesquisa, e assume isso.

O custo e o limite

A qualidade da resposta é a qualidade do acervo

O sistema responde a partir do que foi indexado. Se o escritório indexa documento desatualizado, a resposta será uma citação perfeita de algo que não vale mais. Atualizar o acervo continua sendo trabalho do escritório — e conferir a fonte continua sendo trabalho do advogado.

  • O modelo de vetor é grande e pede alguns gigabytes de memória para rodar na máquina.
  • A geração de texto é opcional e depende de serviço externo; sem ela, o sistema devolve apenas os trechos.
  • É material de estudo: não substitui orientação jurídica e não foi feito para operação multiusuário.
  • O roteiro do projeto já prevê reordenação dos resultados, filtro por tipo de documento e métricas de qualidade.

Como avaliar em uma semana

Na prática
  • Escolha um tema recorrente e indexe os documentos que o escritório já usa sobre ele.
  • Faça dez perguntas que hoje exigiriam leitura de muitas páginas.
  • Confira se cada resposta aponta documento e página corretos.
  • Teste uma pergunta sobre conceito que costuma aparecer com nome diferente nas peças.
  • Meça o tempo até a resposta útil, comparando com a pesquisa manual.
Em recuperação de informação jurídica, o que não funcionou ensina mais rápido do que a demonstração que deu certo.Equipe IDEIA

Perguntas frequentes

É buscar primeiro e responder depois. Em vez de o modelo responder de memória, o sistema procura os trechos mais relevantes no acervo do escritório e escreve a resposta apenas com base neles, citando de onde veio cada informação. É o que permite usar IA em pesquisa jurídica sem aceitar citação inventada.
Sim, e é o uso mais interessante. O projeto permite indexar os arquivos que você colocar, ou usar um conjunto de demonstração com Constituição, Código Civil e julgados. Indexando o acervo da casa, a pesquisa passa a responder com a produção do próprio escritório — e não com o que o modelo lembra de ter lido em algum lugar.
Porque evita que o próximo projeto repita o mesmo caminho. Boa parte do custo de montar busca inteligente está em tentativa e erro: formato de divisão do texto, tamanho do bloco, escolha do modelo de vetor e do índice. Quando alguém publica o que testou e por que trocou, o escritório economiza semanas.
Escrito por
Equipe IDEIA
IDEIA Tecnologia da Informação

Time da IDEIA que implanta busca e IA sobre acervo jurídico, com fonte rastreável e revisão do advogado em cada resultado.

Quer levar isso para a rotina do seu escritório?

A IDEIA implanta IA jurídica, produtividade e infraestrutura com o seu time, com treinamento e suporte. Fale com a gente e a gente desenha o próximo passo.