O Problema era Simples: O cliente precisava enriquecer 1.2 milhão de registros de veículos com dados oficiais da tabela FIPE: placa por placa, marca por marca, modelo por modelo.
Cada veículo precisava ser cruzado com a base oficial para obter preço, ano e versão. Mas os dados de entrada vinham sujos: "L-200 CD TRITON" no sistema do cliente vs "L200 Triton HPE 3.2 CD TB Int.Diesel Aut" na FIPE.
O sistema antigo acertava só 58%. Os outros 42%? Reprocessamento manual ou perda do dado.
O Custo Real do Sistema Antigo
Infraestrutura Cara
Servidores rodando 24/7 para processar a fila
- Custo de infra: US$ 2.400/mês
- Anual: US$ 28.800
Operação Travada Pela API Externa
A API da fonte oficial falhava em 30% das tentativas
- 18% de timeouts (a API simplesmente não respondia)
- 12% de erros 500 (erro do servidor da fonte)
- A cada 3 placas tentadas, 1 voltava com erro
- Equipe gastando horas reprocessando manualmente os erros
Velocidade Baixa
Throughput: 120 placas por minuto
- Para processar 1.2M veículos: cerca de 7 dias rodando 24/7
- Cliente precisava do dado em horas, não em dias
- Cada nova rodada de enriquecimento atrasava o produto
Qualidade Ruim do Dado
Precisão de matching: 58%. Cobertura (ano correto): 82%.
- 42% dos veículos vinham sem dado FIPE associado
- Cliente final via "preço indisponível" no produto
- Equipe comercial perdia negócios por dado faltando
Custo total mensal direto: US$ 2.400 só em infraestrutura, mais o custo invisível de equipe reprocessando manualmente e oportunidade perdida.
O Que Mudou: Três Técnicas Combinadas
A solução não foi "trocar o algoritmo de matching". Foi combinar três técnicas que se reforçam, atacando os três gargalos diferentes ao mesmo tempo.
Analogia simples: se a roda do carro está quadrada, não adianta polir o eixo. É preciso reformular roda, eixo e suspensão juntos. Foi isso.
1. Matching mais inteligente
Em vez de exigir texto idêntico, o sistema aprendeu a comparar palavras em comum, substrings e variações de ordem. "L-200 CD TRITON" e "L200 Triton HPE 3.2" agora são reconhecidos como o mesmo carro.
2. Memória do que já foi consultado
Em vez de perguntar para a API externa toda vez (e ela travar), o sistema lembra das consultas anteriores. Se já consultamos um Civic 2020 antes, não precisamos perguntar de novo.
3. Trabalho em paralelo + tolerância a falha
Em vez de processar 5 placas por vez (sequencial), o sistema processa 200 ao mesmo tempo. E quando a API falha, ele tenta de novo automaticamente, com pausas progressivas, sem precisar de ninguém olhando.
Resultados Mensuráveis
| Métrica | Antes | Depois | Ganho |
|---|---|---|---|
| Precisão do matching | 58% | 94.7% | +63% relativos |
| Cobertura (ano correto) | 82% | 99.2% | +21% relativos |
| Throughput | 120 placas/min | 1.840 placas/min | 15x mais rápido |
| Taxa de sucesso na API | 82% | 97.3% | +19% relativos |
| Tempo médio por placa | 12,5 segundos | 0,7 segundo | 94% menos |
| Chamadas externas/veículo | 150 | 8 | 95% menos |
| Custo de infra/mês | US$ 2.400 | US$ 600 | 75% redução |
Volume processado em produção: mais de 1.2 milhão de veículos rodando 24/7 desde janeiro de 2025.
ROI Detalhado
Custo Mensal Antigo
Infraestrutura: US$ 2.400/mês
Custo Mensal Novo
Infraestrutura: US$ 600/mês
Economia
Mensal: US$ 1.800
Anual: US$ 21.600
Redução: 75%
Ganho Operacional
Tempo de processar 1.2M veículos passou de cerca de 7 dias para menos de 12 horas.
O ciclo de atualização de dados deixou de ser semanal e passou a ser diário, sem custo extra.
Impactos Além do Financeiro
Cliente Final Vendo Mais Dado
Antes: 42% dos veículos sem preço FIPE → tela com "indisponível"
Depois: 99.2% de cobertura → cliente vê o preço quase sempre
Resultado: equipe comercial fechando mais negócios, menos abandono no funil
Equipe Liberada
Antes: alguém revisando e reprocessando erros da API toda semana
Depois: sistema se cura sozinho, equipe só recebe alerta em casos extremos
Resultado: time focado em evolução do produto, não em manutenção operacional
Velocidade de Atualização
Antes: uma rodada de enriquecimento por semana
Depois: rodada diária (ou sob demanda)
Resultado: dado sempre atual, decisões de preço mais rápidas
Escalabilidade
Antes: mais veículos = mais semanas de processamento
Depois: mais veículos = mesma janela diária
Resultado: crescimento sem custo proporcional
Tecnologia Utilizada (Resumo Executivo)
Algoritmo de matching: RapidFuzz (motor em Rust, comparação de texto rápida)
Memória de consultas: PostgreSQL (banco relacional padrão de mercado)
Processamento paralelo: Python AsyncIO + Playwright
Orquestração: Prefect (jobs agendados sem servidor pesado)
Custo de licença: US$ 0 (todas as ferramentas são open-source)
Quando Faz Sentido Investir Nesse Tipo de Solução?
Quando NÃO Faz Sentido
Próximos Passos
Se sua empresa convive com:
- Dados sujos que não casam com bases oficiais
- APIs externas instáveis travando o pipeline
- Equipe revisando manualmente o que deveria ser automático
- Conta de cloud subindo sem dado novo entrando
A combinação certa de técnicas paga em poucos meses e transforma um pipeline frágil em uma operação 24/7 confiável.
Quer entender quanto sua empresa perde com matching de baixa precisão ou pipelines instáveis?
Fazemos uma análise gratuita e mostramos:
- Custo real do pipeline atual (infra + equipe + cobertura perdida)
- ROI esperado da combinação de técnicas
- Payback estimado
- Plano de migração sem parar o produto
"Mesmo dado de entrada. Mesma fonte externa. 94.7% de precisão e 75% menos custo."
