Непростой датасет. Что делать с признаком в виде текста, как строить модель?

Допустим имеется такой датасет:

<div class="cell code_cell rendered selected" tabindex="2"><div class="input"><div class="prompt_container"><div class="prompt input_prompt"><bdi>In</bdi>&nbsp;[359]:</div><div class="run_this_cell" title="Run this cell"><i class="fa-step-forward fa"></i></div></div><div class="inner_cell"><div class="ctb_hideshow"><div class="celltoolbar"></div></div><div class="input_area" aria-label="Edit code here"><div class="CodeMirror cm-s-ipython"><div style="overflow: hidden; position: relative; width: 3px; height: 0px; top: 5.59375px; left: 34.7917px;"><textarea autocorrect="off" autocapitalize="off" spellcheck="false" tabindex="0" style="position: absolute; bottom: -1em; padding: 0px; width: 1000px; height: 1em; outline: none;"></textarea></div><div class="CodeMirror-vscrollbar" tabindex="-1" cm-not-content="true"><div style="min-width: 1px; height: 0px;"></div></div><div class="CodeMirror-hscrollbar" tabindex="-1" cm-not-content="true"><div style="height: 100%; min-height: 1px; width: 0px;"></div></div><div class="CodeMirror-scrollbar-filler" cm-not-content="true"></div><div class="CodeMirror-gutter-filler" cm-not-content="true"></div><div class="CodeMirror-scroll" tabindex="-1"><div class="CodeMirror-sizer" style="margin-left: 0px; min-width: 37.7917px; margin-bottom: -17px; border-right-width: 13px; min-height: 28px; padding-right: 0px; padding-bottom: 0px;"><div style="position: relative; top: 0px;"><div class="CodeMirror-lines" role="presentation"><div role="presentation" style="position: relative; outline: none;"><div class="CodeMirror-measure"></div><div class="CodeMirror-measure"></div><div style="position: relative; z-index: 1;"></div><div class="CodeMirror-cursors" style=""><div class="CodeMirror-cursor" style="left: 34.7917px; top: 0px; height: 16.6667px;">&nbsp;</div></div><div class="CodeMirror-code" role="presentation"><pre class=" CodeMirror-line " role="presentation"><span role="presentation" style="padding-right: 0.1px;"><span class="cm-variable">data</span></span></pre></div></div></div></div></div><div style="position: absolute; height: 13px; width: 1px; border-bottom: 0px solid transparent; top: 28px;"></div><div class="CodeMirror-gutters" style="display: none; height: 41px;"></div></div></div></div></div></div><div class="output_wrapper"><div class="out_prompt_overlay prompt" title="click to scroll output; double click to hide" style=""></div><div class="output" style=""><div class="output_area"><div class="run_this_cell"></div><div class="prompt output_prompt"><bdi>Out[359]:</bdi></div><div class="output_subarea output_html rendered_html output_result"><div>
<style scoped="">
    .dataframe tbody tr th:only-of-type {
        vertical-align: middle;
    }

    .dataframe tbody tr th {
        vertical-align: top;
    }

    .dataframe thead th {
        text-align: right;
    }
</style>
<table border="1" class="dataframe">
  <thead>
    <tr style="text-align: right;">
      <th></th>
      <th>работник</th>
      <th>Участок</th>
      <th>Исправлено</th>
      <th>Время</th>
      <th>найдено недостатков</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <th>0</th>
      <td>Иван</td>
      <td>Cварочная</td>
      <td>Починил винт</td>
      <td>2020-06-12 14:26:12</td>
      <td>1</td>
    </tr>
    <tr>
      <th>1</th>
      <td>Алена</td>
      <td>Котельная</td>
      <td>затянула гайку</td>
      <td>2020-06-12 11:53:10</td>
      <td>4</td>
    </tr>
    <tr>
      <th>2</th>
      <td>Сергей</td>
      <td>цех</td>
      <td>поменял кран</td>
      <td>2020-06-12 14:00:10</td>
      <td>4</td>
    </tr>
  </tbody>
</table>
</div></div></div></div><div class="btn btn-default output_collapsed" title="click to expand output" style="display: none;">. . .</div></div></div>

Подскажите пожалуйста, нужна найти взаимосвязь от "найдено недостатков" с остальными признаками. Как обработать остальные признаки. Допусти ввести дамми переменные, а признак исправленно пропустить через мешок слов, но тогда какую модель выбрать? Имеет ли смысл после мешка слов добавлять остальные признаки? Или разделить найдено недостатков на класы: мало, среднее и много? И провести классификацию?Или попробовать кластеризовать? Какой в целом подход выбрать?


Ответы (1 шт):

Автор решения: CrazyElf

Вообще-то типовой процесс Data Science в том и состоит, что вы выдвигаете гипотезы, пробуете их, если качество устраивает - стоп, если не устраивает - придумываете ещё признаки, генерите новые идеи - и опять пробуете. Идей вы на мой взгляд нагенерили уже достаточно - пробуйте, смотрите качество модели. Если идеи кончатся, а качество модели всё ещё не будет устраивать - вот тогда и приходите за новыми идеями. Пока идей у вас достаточно, дело за их проверкой. Никто не может заранее сказать, какие признаки окажутся полезными, а какие нет. Всё это только через проверку имеющихся гипотез на ваших конкретных данных можно понять.

→ Ссылка