Как очистить данные в excel файле от дубликатов в Pandas?
Начинающий дата аналитик. Нужно очистить данные в python, взятые из xlsx файла. У части строк есть свой дубликат, но с дополнительными данными.
Также, у дубликатов в есть своя кодировка в первом столбце (x,y,z). Как собрать все данные по строке из дубликатов, убрать эти дубликаты и заменить столбец с кодировкой на новый столбец с перечислением кодировок? С какой стороны заходить сначала и какие технологии можно применить?
Такая таблица должна получится в итоге:
В электронном виде:
Input
Code NAME ID LON LAT NAME of place
0 1 Barbarian 00001 57 91
1 1 Bard 58 92 Soltmarsh
2 1 Cleric 00003
3 1 NaN 00004 60 94 Valakkia
4 1 Wizard 00005 61
5 1 Warrior 00006 62 96
6 1 Rogue 00007 63 97
7 1 Monk 00009 65 99
8 1 NaN 66 100 Waterdeep
9 2 NaN 57 91 Waterdeep
10 2 Bard 00002 58 Soltmarsh
11 2 Cleric 00003 59 Barovia
12 2 Mage 60 94 Valakkia
13 2 Wizard 00005 61
14 2 Warrior Abyss
15 2 Rogue 00007 63 97
16 2 NaN 99 Laylon
17 2 NaN 66 100 Waterdeep
18 3 Barbarian 00001 57 91
19 3 NaN 00002 58 Soltmarsh
20 3 Mage 00004 60 94
21 3 Wizard 61 95
22 3 NaN 00006 62 96 Abyss
23 3 Rogue 00007 63 97
24 3 Druid 00008 64 98 Neverwinter
25 3 Monk 00009
26 3 Warlock 00010 66 100 Waterdeep `
Output
NAME ID LON LAT NAME of place Codes
0 Barbarian 1 57 91 Waterdeep 1, 2, 3
1 Bard 2 58 92 Soltmarsh 1, 2, 3
2 Cleric 3 59 93 Barovia 1, 2
3 Mage 4 60 94 Valakkia 1, 2, 3
4 Wizard 5 61 95 Soltmarsh 1, 2, 3
5 Warrior 6 62 96 Abyss 1, 2, 3
6 Rogue 7 63 97 Baldur's Gate 1, 2, 3
7 Druid 8 64 98 Neverwinter 3
8 Monk 9 65 99 Laylon 1, 2, 3
9 Warlock 10 66 100 Waterdeep 1, 2, 3

