Duplikaty według reguły dopasowania · 5100 rekordów
Dane wykresu
| Reguła | Duplikaty |
|---|---|
| NIP po ujednoliceniu zapisu | 200 |
| Nazwa + kod pocztowy (brak NIP) | 75 |
| Niewykryte (literówki, brak NIP) | 25 |
Duplikaty według reguły dopasowania · 5100 rekordów
Dane wykresu
| Reguła | Duplikaty |
|---|---|
| NIP po ujednoliceniu zapisu | 200 |
| Nazwa + kod pocztowy (brak NIP) | 75 |
| Niewykryte (literówki, brak NIP) | 25 |
Porządkowanie bazy klientów
- Problem
- Ten sam klient zapisany w CRM kilka razy — z różnym zapisem NIP-u i nazwy.
- Dane
- 5100 rekordów, w tym 300 ukrytych duplikatów: NIP z myślnikami, spacjami i prefiksem PL, nazwy wielkimi literami, różne zapisy formy prawnej.
- Praca
- Ujednolicenie NIP-ów i nazw, dwie reguły dopasowania (NIP; nazwa z kodem pocztowym dla rekordów bez NIP), raport jakości z listą do weryfikacji.
- Rezultat
- Wykryte 275 z 300 duplikatów (91,7%), bez fałszywych dopasowań. Pozostałe 25 to nazwy z literówką i bez NIP — wymagają dopasowania przybliżonego lub ręcznej weryfikacji.
- Narzędzia
- Power Query, R