Dois registros podem representar a mesma empresa, pessoa, produto ou fornecedor mesmo quando seus campos não são idênticos. Abreviações, erros de digitação, documentos incompletos e diferenças entre sistemas criam duplicidades difíceis de detectar. A resolução de entidades no MDM é o processo usado para comparar esses registros, estimar se pertencem à mesma entidade real e vinculá-los a um identificador mestre confiável.
Esse trabalho é essencial para formar o chamado golden record, reduzir cadastros redundantes e melhorar análises, integrações e processos operacionais. Neste guia, você entenderá como combinar regras, similaridade e aprendizado de máquina sem transformar o matching em uma caixa-preta.
O que é resolução de entidades?
Resolução de entidades, também chamada de entity resolution ou record linkage, identifica registros que se referem ao mesmo objeto do mundo real. O resultado costuma ser um grupo de registros relacionados, associado a um Match ID ou a um identificador mestre.
Ela não é sinônimo de simples remoção de duplicidades. A deduplicação geralmente procura repetições dentro de uma base. A resolução de entidades também conecta registros entre CRM, ERP, e-commerce, sistemas legados, portais de fornecedores e fontes externas.
Por que o problema é mais difícil do que parece?
- nomes podem conter abreviações, ordem diferente ou erros de digitação;
- endereços mudam e são escritos de várias formas;
- telefones e documentos podem estar incompletos;
- uma mesma organização pode possuir filiais e matrizes;
- produtos podem ter descrições diferentes e códigos equivalentes;
- campos confiáveis em um sistema podem estar desatualizados em outro.
Por isso, comparar apenas um campo raramente é suficiente. Uma boa estratégia considera múltiplos atributos, a confiabilidade de cada fonte e o custo de um falso positivo ou falso negativo.
As cinco etapas de um processo de matching
1. Preparação e normalização
Antes da comparação, padronize caixa, acentuação, espaços, pontuação, telefones, documentos, unidades de medida e endereços. Também trate valores nulos e separe campos compostos. A normalização evita que diferenças apenas de formato reduzam a qualidade do matching.
2. Blocking ou geração de candidatos
Comparar todos os registros entre si pode ser inviável. O blocking cria grupos plausíveis usando chaves como parte do documento, CEP, domínio de e-mail, fabricante ou fonética do nome. Assim, o algoritmo avalia apenas pares com alguma chance de correspondência.
3. Comparação de atributos
Cada par candidato recebe medidas de similaridade. O documento pode exigir igualdade exata; o nome pode usar distância de edição ou fonética; o endereço pode combinar logradouro, número e CEP; uma descrição de material pode considerar tokens, fabricante e características técnicas.
4. Classificação da correspondência
As evidências são combinadas para classificar o par como correspondência, não correspondência ou caso duvidoso. A decisão pode vir de regras determinísticas, de uma pontuação probabilística ou de um modelo de aprendizado de máquina.
5. Agrupamento e consolidação
Os pares aprovados são agrupados em entidades. Depois, regras de sobrevivência escolhem os valores que formarão o registro mestre, preservando linhagem e referências aos sistemas de origem.
Matching determinístico, fuzzy ou com machine learning?
Regras determinísticas
Funcionam bem quando existem identificadores estáveis e dados padronizados. Uma regra pode considerar correspondência quando CNPJ e país são iguais, ou quando código do fabricante e unidade de medida coincidem. São explicáveis, auditáveis e fáceis de ajustar.
Correspondência aproximada
O fuzzy matching calcula similaridade entre textos e tolera pequenas variações. É útil para nomes, endereços e descrições, mas precisa de limiares calibrados por domínio. Um limite adequado para clientes pode ser inadequado para materiais.
Aprendizado de máquina
Modelos podem aprender combinações complexas de sinais e reconhecer padrões que regras fixas não capturam. A documentação do AWS Entity Resolution descreve workflows baseados em regras, machine learning e serviços de provedores. Independentemente da tecnologia, decisões de alto impacto devem manter explicabilidade, métricas e revisão humana.
Exemplo prático: fornecedores duplicados
Imagine três registros: “Indústria Alfa Ltda.”, “Industria Alfa” e “Alfa Ind. LTDA”. Um possui CNPJ completo; outro, apenas telefone; o terceiro, endereço e domínio de e-mail. O processo pode:
- normalizar razão social, telefone e endereço;
- gerar candidatos pelo domínio, CEP e fragmento do CNPJ;
- atribuir pesos maiores ao documento e ao domínio corporativo;
- calcular similaridade dos nomes e endereços;
- encaminhar o caso limítrofe a um Data Steward;
- criar um identificador mestre e preservar todos os IDs de origem.
A homologação não deve ser confundida com o matching: identificar que dois registros representam o mesmo fornecedor não significa aprová-lo automaticamente. Validação documental, risco e políticas comerciais continuam sendo etapas próprias.
Como calibrar os limiares
Use uma amostra rotulada com pares verdadeiros e falsos. Divida os resultados em correspondências automáticas, rejeições automáticas e zona de revisão. Ajuste os limites com base no impacto do erro. Fundir dois clientes diferentes pode ser mais grave do que deixar uma duplicidade temporariamente separada.
Monitore precisão, cobertura, taxa de revisão manual, tempo de decisão e reversões. Acurácia isolada pode enganar quando a maioria dos pares não corresponde.
Governança e auditoria
- defina quem aprova regras e limiares;
- registre a versão do algoritmo usada em cada decisão;
- preserve evidências e dados de origem;
- permita desfazer agrupamentos incorretos;
- controle acesso a atributos pessoais ou sensíveis;
- revise o desempenho quando fontes e padrões mudarem.
O Data Steward é fundamental para resolver exceções e transformar casos recorrentes em novas regras. Já os contratos de dados no MDM ajudam a garantir que produtores entreguem campos com qualidade suficiente para o matching.
Métricas recomendadas
- precisão: proporção das correspondências aprovadas que são corretas;
- recall ou cobertura: proporção das correspondências reais que foram encontradas;
- falsos positivos: entidades diferentes agrupadas por engano;
- falsos negativos: duplicidades que permaneceram separadas;
- taxa de revisão: percentual encaminhado à análise humana;
- tempo de resolução: intervalo entre detecção e decisão;
- estabilidade: frequência de agrupamentos desfeitos após mudanças.
Erros que prejudicam a resolução de entidades
- usar um único limiar para todos os domínios;
- tratar campos ausentes como divergência definitiva;
- não separar matriz, filial e grupo econômico;
- ignorar mudanças de endereço, telefone ou razão social;
- fundir automaticamente casos de alto risco;
- não medir falsos positivos e falsos negativos;
- perder a linhagem depois de formar o registro mestre.
Perguntas frequentes
Resolução de entidades serve apenas para clientes?
Não. Ela também pode ser aplicada a fornecedores, produtos, materiais, ativos, colaboradores e localidades, desde que atributos e critérios sejam definidos para cada domínio.
Machine learning elimina a revisão humana?
Não necessariamente. Casos ambíguos, alterações sensíveis e decisões com grande impacto continuam se beneficiando da validação de especialistas.
Qual é o melhor ponto de partida?
Escolha uma entidade relevante, obtenha uma amostra rotulada, comece com regras explicáveis e crie uma zona de revisão. Depois, compare abordagens mais sofisticadas usando métricas de negócio.
Conclusão
A resolução de entidades transforma registros dispersos em identidades confiáveis. O resultado depende menos de um algoritmo isolado e mais da combinação entre normalização, bons atributos, regras adequadas ao domínio, governança e monitoramento contínuo. Quando integrada ao MDM, ela reduz duplicidades sem sacrificar rastreabilidade e controle.
Conheça a 4MDG
A 4MDG é uma solução SaaS completa de MDM com homologação de fornecedores, onboarding de clientes e padronização descritiva de materiais.
www.4mdg.com.br
Fone: (11) 4113-2510
Fontes consultadas
- AWS — visão geral do Entity Resolution
- AWS — workflows e técnicas de matching
- AWS — matching baseado em regras
Nota editorial: este conteúdo é educacional. Regras, limiares, modelos e controles devem ser validados conforme o risco, a legislação e o contexto de cada organização.
Quer conhecer sobre o universo dos dados mestres?
Receba gratuitamente nosso e-book sobre MDM e entre em uma das carreiras mais quente do momento
0 Comentários