В какой системе счисления хранить и сравнивать текст в файле данных для Pandas? А для Numba?

  • Большой датафрейм с данными, есть колонки с float, int и несколько колонок с string, set(strings). Периодически запросы выборки по условиям, и с числами и с текстом df[ (df['col1'] > x) & ('xyz' in df['col2']) & (df['col2'] == 'abc')]. Колонки с числами я могу привести к минимальным контейнерам int или float. А вот string в каком виде лучше хранить и добавлять в датафрейм чтобы потом быстрее выполнялось ('xyz' in df['col2']) & (df['col2'] == 'abc')? Ну вроде ближе к нативному машинному, чтобы Pandas быстрее их декодировал.
  • И производный вопрос - а Numba @njit можно заставить сравнивать текст простым ==, представляя его в какой-л. системе счисления типа HEX или другого? Хочется найти максимально быстрый способ выборки из массива данных. Всё буду тестить.

Ответы (0 шт):