Qualidade de dados

Deduplicação de dados no Salesforce com matching fuzzy

Ilustração do artigo

"Acme Corp", "Acme Corp.", "ACME CORPORATION". Para o vendedor são três contas; para o negócio é uma só, triplicada. Duplicata suja relatório, quebra automação e faz o time ligar duas vezes para o mesmo cliente. As regras de duplicata nativas ajudam, mas travam em variação de escrita. É aí que entra o matching fuzzy.

Por que a regra de match exata não basta

A deduplicação padrão compara campos de forma rígida. "Acme Corp" e "ACME CORPORATION" não batem por igualdade. O que resolve é medir quão parecidos os textos são, com um score, e tratar tudo acima de um limiar como provável duplicata.

Os algoritmos que medem semelhança de texto

  • Levenshtein: conta o mínimo de edições (inserir, apagar, trocar letra) para transformar um texto no outro. Bom para erros de digitação.
  • Jaro-Winkler: favorece textos que começam igual, ótimo para nomes de empresa e pessoa. Devolve um score de 0 a 1.

Ambos dão para implementar em Apex e rodar sobre a base. A escolha do algoritmo e do limiar de corte deve ser configurável (via Custom Metadata), porque o que é "parecido o suficiente" muda por objeto e por cliente.

Agrupar as duplicatas: union-find

Se A é parecido com B, e B com C, então A, B e C são o mesmo cluster, mesmo que A e C não tenham batido diretamente. O algoritmo union-find resolve esse agrupamento transitivo de forma eficiente, permitindo varrer a base em volume com um Batch e formar os grupos de prováveis duplicados.

Mesclar com segurança: o merge nativo

Encontrar é metade do trabalho; mesclar sem perder dado é a outra. O Salesforce tem merge nativo (para Account, Contact e Lead) que reparenta registros filhos e preserva o histórico. O ideal é um fluxo assistido: o sistema mostra o cluster e o score, a pessoa escolhe o registro vencedor, e o merge acontece com um clique, sem script arriscado apagando dado.

O resultado para o negócio

  • Relatórios e forecast param de contar o mesmo cliente várias vezes.
  • Automação e roteamento deixam de disparar em duplicidade.
  • O time comercial confia de novo no CRM, em vez de manter a planilha paralela.

Vale separar dois problemas que costumam ser confundidos. Deduplicar resolve o mesmo cliente repetido dentro do próprio CRM. Quando o cliente está espalhado entre sistemas diferentes, e-commerce, atendimento e CRM, aí a conversa muda de patamar e entra o Salesforce Data Cloud. Saber qual dos dois é o seu caso evita comprar plataforma cara para um problema que a deduplicação já resolve.

Sua base está cheia de duplicatas?

Eu implemento detecção de duplicatas com matching fuzzy configurável e merge assistido, para limpar a base sem risco de perder dado. Comece com um diagnóstico gratuito de 45 minutos.

Falar no WhatsApp Ver serviços