Поиск дубликатов в клиентском MDM на миллиард записей

Джерело:
Хабрахабр:

Дата публікації:
01/10/2024 10:51

Постійна адреса новини:
http://www.vsinovyny.com/11330946

Поиск дубликатов в клиентском MDM на миллиард записей

 

01/10/2024 10:51 // Хабрахабр:

Представьте, что вам нужно объединить две базы данных с информацией о клиентах, каждая из которых содержит несколько миллионов записей. В них есть ФИО, паспортные данные, СНИЛС, даты рождения, адреса и другие данные. Ваша задача — найти все похожие записи и не допустить ошибочных объединений. 

Причем данные могут содержать ошибки, опечатки операторов или неверные транскрипции. Для полной сверки каждого с каждым потребуются триллионы операций сравнения. И вишенка на торте — братья-близнецы с редкими, но созвучными именами. Даже оператор может решить, что это дубль, и объединить их записи.

Цена ошибки неверного объединения или дублирования выражается в репутации компании и конкретных суммах на счетах клиентов, к которым могут получить доступ посторонние люди.

В этом посте расскажу о работе нашей системы обработки данных, которую мы применяем и адаптируем под такие сложные случаи.

Читать далее

 

» Читати повністю

 

« Наступна новина з архіву
[Перевод] Как доказать теорию относительности Эйнштейна за 10 000 рублей
  Попередня новина з архіву
У Японії призначили нового прем'єр-міністра
»

 

 
© 2026 www.vsinovyny.com