Главная › Лекции › Лекции одного дата-шрушера (ВШЭ) — Анализ данных на Python

Логистическая регрессия: модель, обучение и оценка

Лекция объясняет, как логистическая регрессия моделирует вероятность класса, как её обучают и проверяют на примере данных о покемонах.

Лекции одного дата-шрушера⏱ 74 минОткрыть на YouTube ↗
Пройти весь тест — 9 вопросов →

Бесплатно, нужен вход через Google. Готовый тест не тратит часовой лимит.

О чём лекция

Лекция посвящена задаче классификации, где целевая переменная принимает значения 0 или 1. Обычная линейная регрессия для неё неудобна: её прогнозы не ограничены диапазоном вероятностей и могут плохо описывать переход между классами. Вместо неё линейную комбинацию признаков преобразуют сигмоидой — функцией логистического распределения, которая выдаёт значение от 0 до 1. Его можно трактовать как вероятность класса 1, а затем отнести объект к классу, сравнив вероятность с выбранным порогом. Коэффициенты модели связаны с логарифмом отношения шансов; их интерпретация отличается от интерпретации коэффициентов линейной регрессии.

Для обучения обсуждаются среднеквадратичная ошибка и логистические потери. Последние зависят от предсказанной вероятности и сильнее штрафуют уверенные ошибочные прогнозы. На примере таблицы с характеристиками покемонов строится модель, предсказывающая, является ли покемон легендарным. Данные делят на обучающую и тестовую части, сохраняя долю редкого положительного класса с помощью стратификации. После обучения модель выдаёт вероятности классов; качество ранжирования оценивают метрикой ROC AUC, которая показывает, насколько часто объект класса 1 получает более высокий прогноз, чем объект класса 0.

Ключевые идеи

Примеры вопросов

В задаче бинарной классификации логистическая регрессия выдала для объекта число 0,8. Как корректнее всего интерпретировать этот результат?

  1. AМодель сообщает, что значение линейного предиктора объекта равно 0,8
  2. BМодель утверждает, что объект принадлежит положительному классу ровно на 80% своих признаков
  3. CМодель гарантирует, что в 80% случаев классификация этого конкретного объекта будет правильной
  4. DМодель оценивает вероятность принадлежности объекта к положительному классу как 0,8
Показать ответ

Верный ответ: D. Выход логистической регрессии лежит между 0 и 1 и может рассматриваться как оценка вероятности положительного класса. Это не гарантия правильности, не доля признаков и не обязательно значение линейного предиктора.

В логистической регрессии для бинарного исхода при одном наблюдаемом факторе вводят скрытую переменную, которую напрямую нельзя измерить. Какую роль она выполняет в модели?

  1. AОна отражает индивидуальную склонность объекта относиться к одному из классов
  2. BОна является непосредственно наблюдаемым значением целевой переменной
  3. CОна задаёт величину штрафа за слишком большие коэффициенты
  4. DОна показывает величину ошибки предсказания для каждого объекта
Показать ответ

Верный ответ: A. Скрытая переменная описывает внутреннюю выраженность склонности к классу, тогда как фактический класс, ошибка и регуляризационный штраф имеют другие функции.

Пройти весь тест — 9 вопросов →

Свой тест по любой лекции

Вставьте ссылку на видео — LearnReplay сделает тест на понимание.

Создать тест →