Cases & ROILeitura 6 min

Matching de Veículos em Escala: De 58% Para 94.7% de Precisão (e 75% Menos Custo de Infra)

Jonas HamerskiData Engineer | RPA/Web Scraping | Backend Python9 de maio de 20266 min

O Problema era Simples: O cliente precisava enriquecer 1.2 milhão de registros de veículos com dados oficiais da tabela FIPE: placa por placa, marca por marca, modelo por modelo.

Cada veículo precisava ser cruzado com a base oficial para obter preço, ano e versão. Mas os dados de entrada vinham sujos: "L-200 CD TRITON" no sistema do cliente vs "L200 Triton HPE 3.2 CD TB Int.Diesel Aut" na FIPE.

O sistema antigo acertava só 58%. Os outros 42%? Reprocessamento manual ou perda do dado.


O Custo Real do Sistema Antigo

Infraestrutura Cara

Servidores rodando 24/7 para processar a fila

  • Custo de infra: US$ 2.400/mês
  • Anual: US$ 28.800

Operação Travada Pela API Externa

A API da fonte oficial falhava em 30% das tentativas

  • 18% de timeouts (a API simplesmente não respondia)
  • 12% de erros 500 (erro do servidor da fonte)
  • A cada 3 placas tentadas, 1 voltava com erro
  • Equipe gastando horas reprocessando manualmente os erros

Velocidade Baixa

Throughput: 120 placas por minuto

  • Para processar 1.2M veículos: cerca de 7 dias rodando 24/7
  • Cliente precisava do dado em horas, não em dias
  • Cada nova rodada de enriquecimento atrasava o produto

Qualidade Ruim do Dado

Precisão de matching: 58%. Cobertura (ano correto): 82%.

  • 42% dos veículos vinham sem dado FIPE associado
  • Cliente final via "preço indisponível" no produto
  • Equipe comercial perdia negócios por dado faltando

Custo total mensal direto: US$ 2.400 só em infraestrutura, mais o custo invisível de equipe reprocessando manualmente e oportunidade perdida.


O Que Mudou: Três Técnicas Combinadas

A solução não foi "trocar o algoritmo de matching". Foi combinar três técnicas que se reforçam, atacando os três gargalos diferentes ao mesmo tempo.

Analogia simples: se a roda do carro está quadrada, não adianta polir o eixo. É preciso reformular roda, eixo e suspensão juntos. Foi isso.

1. Matching mais inteligente

Em vez de exigir texto idêntico, o sistema aprendeu a comparar palavras em comum, substrings e variações de ordem. "L-200 CD TRITON" e "L200 Triton HPE 3.2" agora são reconhecidos como o mesmo carro.

2. Memória do que já foi consultado

Em vez de perguntar para a API externa toda vez (e ela travar), o sistema lembra das consultas anteriores. Se já consultamos um Civic 2020 antes, não precisamos perguntar de novo.

3. Trabalho em paralelo + tolerância a falha

Em vez de processar 5 placas por vez (sequencial), o sistema processa 200 ao mesmo tempo. E quando a API falha, ele tenta de novo automaticamente, com pausas progressivas, sem precisar de ninguém olhando.


Resultados Mensuráveis

MétricaAntesDepoisGanho
Precisão do matching58%94.7%+63% relativos
Cobertura (ano correto)82%99.2%+21% relativos
Throughput120 placas/min1.840 placas/min15x mais rápido
Taxa de sucesso na API82%97.3%+19% relativos
Tempo médio por placa12,5 segundos0,7 segundo94% menos
Chamadas externas/veículo150895% menos
Custo de infra/mêsUS$ 2.400US$ 60075% redução

Volume processado em produção: mais de 1.2 milhão de veículos rodando 24/7 desde janeiro de 2025.


ROI Detalhado

Custo Mensal Antigo

Infraestrutura: US$ 2.400/mês

Custo Mensal Novo

Infraestrutura: US$ 600/mês

Economia

Mensal: US$ 1.800

Anual: US$ 21.600

Redução: 75%

Ganho Operacional

Tempo de processar 1.2M veículos passou de cerca de 7 dias para menos de 12 horas.

O ciclo de atualização de dados deixou de ser semanal e passou a ser diário, sem custo extra.


Impactos Além do Financeiro

Cliente Final Vendo Mais Dado

Antes: 42% dos veículos sem preço FIPE → tela com "indisponível"

Depois: 99.2% de cobertura → cliente vê o preço quase sempre

Resultado: equipe comercial fechando mais negócios, menos abandono no funil

Equipe Liberada

Antes: alguém revisando e reprocessando erros da API toda semana

Depois: sistema se cura sozinho, equipe só recebe alerta em casos extremos

Resultado: time focado em evolução do produto, não em manutenção operacional

Velocidade de Atualização

Antes: uma rodada de enriquecimento por semana

Depois: rodada diária (ou sob demanda)

Resultado: dado sempre atual, decisões de preço mais rápidas

Escalabilidade

Antes: mais veículos = mais semanas de processamento

Depois: mais veículos = mesma janela diária

Resultado: crescimento sem custo proporcional


Tecnologia Utilizada (Resumo Executivo)

Algoritmo de matching: RapidFuzz (motor em Rust, comparação de texto rápida)

Memória de consultas: PostgreSQL (banco relacional padrão de mercado)

Processamento paralelo: Python AsyncIO + Playwright

Orquestração: Prefect (jobs agendados sem servidor pesado)

Custo de licença: US$ 0 (todas as ferramentas são open-source)


Quando Faz Sentido Investir Nesse Tipo de Solução?

Você cruza dados sujos com fontes externas (FIPE, Receita, CRMs, ERPs)
A taxa de match atual é menor que 80%
A API externa onde você consulta tem instabilidades conhecidas
Equipe gasta horas por semana revisando matches manualmente
O dado precisa estar atualizado diariamente, não semanalmente
O volume está crescendo e a infra cresce junto

Quando NÃO Faz Sentido

Volume baixo (menos de 10 mil registros/mês)
Dados de entrada já estão limpos e padronizados
A fonte externa é estável e barata

Próximos Passos

Se sua empresa convive com:

  • Dados sujos que não casam com bases oficiais
  • APIs externas instáveis travando o pipeline
  • Equipe revisando manualmente o que deveria ser automático
  • Conta de cloud subindo sem dado novo entrando

A combinação certa de técnicas paga em poucos meses e transforma um pipeline frágil em uma operação 24/7 confiável.


Quer entender quanto sua empresa perde com matching de baixa precisão ou pipelines instáveis?

Fazemos uma análise gratuita e mostramos:

  • Custo real do pipeline atual (infra + equipe + cobertura perdida)
  • ROI esperado da combinação de técnicas
  • Payback estimado
  • Plano de migração sem parar o produto

"Mesmo dado de entrada. Mesma fonte externa. 94.7% de precisão e 75% menos custo."
Assuntos
ROIAutomaçãoMatchingFIPEEnriquecimentoDeDadosReducaoDeCustosEscalabilidade
Tem um caso parecido?

A gente coleta o dado na fonte e entrega dentro do seu sistema

Fale direto com quem constrói o robô. A conversa começa pela fonte, pelo volume e pelo destino do dado, não por proposta.