- Большой датафрейм с данными, есть колонки с float, int и несколько
колонок с string, set(strings). Периодически запросы выборки по
условиям, и с числами и с текстом
df[ (df['col1'] > x) & ('xyz' in df['col2']) & (df['col2'] == 'abc')]. Колонки с числами я могу
привести к минимальным контейнерам int или float. А вот string в
каком виде лучше хранить и добавлять в датафрейм чтобы потом быстрее
выполнялось ('xyz' in df['col2']) & (df['col2'] == 'abc')? Ну вроде
ближе к нативному машинному, чтобы Pandas быстрее их декодировал.
- И производный вопрос - а Numba @njit можно заставить сравнивать текст
простым ==, представляя его в какой-л. системе счисления типа HEX или
другого? Хочется найти максимально быстрый способ выборки из массива
данных. Всё буду тестить.