"Acme Corp", "Acme Corp.", "ACME CORPORATION". Para o vendedor são três contas; para o negócio é uma só, triplicada. Duplicata suja relatório, quebra automação e faz o time ligar duas vezes para o mesmo cliente. As regras de duplicata nativas ajudam, mas travam em variação de escrita. É aí que entra o matching fuzzy.
Por que a regra de match exata não basta
A deduplicação padrão compara campos de forma rígida. "Acme Corp" e "ACME CORPORATION" não batem por igualdade. O que resolve é medir quão parecidos os textos são, com um score, e tratar tudo acima de um limiar como provável duplicata.
Os algoritmos que medem semelhança de texto
- Levenshtein: conta o mínimo de edições (inserir, apagar, trocar letra) para transformar um texto no outro. Bom para erros de digitação.
- Jaro-Winkler: favorece textos que começam igual, ótimo para nomes de empresa e pessoa. Devolve um score de 0 a 1.
Ambos dão para implementar em Apex e rodar sobre a base. A escolha do algoritmo e do limiar de corte deve ser configurável (via Custom Metadata), porque o que é "parecido o suficiente" muda por objeto e por cliente.
Agrupar as duplicatas: union-find
Se A é parecido com B, e B com C, então A, B e C são o mesmo cluster, mesmo que A e C não tenham batido diretamente. O algoritmo union-find resolve esse agrupamento transitivo de forma eficiente, permitindo varrer a base em volume com um Batch e formar os grupos de prováveis duplicados.
Mesclar com segurança: o merge nativo
Encontrar é metade do trabalho; mesclar sem perder dado é a outra. O Salesforce tem merge
nativo (para Account, Contact e Lead) que reparenta registros filhos e preserva o histórico. O ideal é um
fluxo assistido: o sistema mostra o cluster e o score, a pessoa escolhe o registro
vencedor, e o merge acontece com um clique, sem script arriscado apagando dado.
O resultado para o negócio
- Relatórios e forecast param de contar o mesmo cliente várias vezes.
- Automação e roteamento deixam de disparar em duplicidade.
- O time comercial confia de novo no CRM, em vez de manter a planilha paralela.
Vale separar dois problemas que costumam ser confundidos. Deduplicar resolve o mesmo cliente repetido dentro do próprio CRM. Quando o cliente está espalhado entre sistemas diferentes, e-commerce, atendimento e CRM, aí a conversa muda de patamar e entra o Salesforce Data Cloud. Saber qual dos dois é o seu caso evita comprar plataforma cara para um problema que a deduplicação já resolve.
Sua base está cheia de duplicatas?
Eu implemento detecção de duplicatas com matching fuzzy configurável e merge assistido, para limpar a base sem risco de perder dado. Comece com um diagnóstico gratuito de 45 minutos.
Falar no WhatsApp Ver serviços