Джерело:
Хабрахабр:
Дата публікації:
30/11/2022 15:55
Постійна адреса новини:
http://www.vsinovyny.com/9509616
30/11/2022 15:55 // Хабрахабр:
Общедоступные реестры клинических исследований, такие как clinicaltrial.gov, печально известны низкой структурированностью данных. Попытка построить сводный отчет, например, о количестве исследований, проводимых ведущими фармкомпаниями, натыкается на давно всем надоевшую проблему множественных написаний одинаковых по смыслу значений.
В очередной раз столкнувшись с этой проблемой при анализе данных в pandas, я решил подключить к решению CountVectorizer из scikit-learn. Результат показался интересным. Сразу оговорюсь, что в данном случае я не использую методы и алгоритмы машинного обучения, а только CountVectorizer как инструмент.
| « |
Наступна новина з архіву Неблокирующий повтор (retry) в Java и проект Loom |
Попередня новина з архіву Как перестать бояться и полюбить менеджер паролей |
» | |
|
|
||||