Бесплатно, нужен вход через Google. Готовый тест не тратит часовой лимит.
О чём лекция
Лекция вводит линейную регрессию как базовый инструмент анализа данных и машинного обучения. Разбирается различие между прогнозированием будущих значений и интерпретацией зависимости между переменными: в первом случае важнее качество прогноза, во втором — корректность и интерпретируемость коэффициентов. На простом примере показывается модель без свободного члена, где число решённых задач зависит от количества съеденных конфет.
Затем рассматриваются функции потерь MAE и MSE. Объясняется, почему простое усреднение ошибок приводит к взаимному сокращению положительных и отрицательных отклонений, а модуль или квадрат ошибки устраняет эту проблему. Для MSE коэффициент линейной модели находится аналитически через минимизацию функции потерь; для более сложных функций предлагается использовать градиентный спуск.
В практической части линейная регрессия строится в statsmodels и scikit-learn на данных о продажах и рекламных расходах. Показаны интерпретация коэффициентов, прогнозирование, логарифмирование переменных для описания убывающей отдачи от рекламы и метрика R². В завершение обсуждаются ограничения R² и переобучение: высокая точность на обучающей выборке не гарантирует хороших прогнозов, поэтому данные следует разделять на обучающую и тестовую части.
Ключевые идеи
Модели анализа данных помогают либо прогнозировать будущее значение переменной, либо объяснять зависимость между переменными.
Для прогнозирования важнее качество результата, а для интерпретации — корректность и статистические свойства коэффициентов.
Линейная регрессия описывает зависимость целевой переменной от фактора с помощью уравнения, в котором коэффициент задаёт пропорцию изменения.
Функция потерь измеряет расхождение между реальным и спрогнозированным значением.
MSE возводит ошибку в квадрат, поэтому сильнее штрафует большие отклонения и обладает удобными статистическими свойствами.
Обучение модели сводится к поиску таких коэффициентов, при которых функция потерь достигает минимума.
Градиентный спуск итеративно изменяет коэффициенты в направлении уменьшения функции потерь.
Высокий R² не исключает переобучения, поэтому качество модели нужно проверять на данных, не использованных при обучении.
Примеры вопросов
При выборе модели машинного обучения для задачи, где главный результат — получить как можно более точный прогноз и использовать его на практике, а объяснение влияния каждого признака не является целью, какой критерий должен иметь наибольший приоритет?
AМинимальное число признаков в модели
BПростота интерпретации коэффициентов
CКачество получаемых прогнозов
DВозможность представить модель в виде линейного уравнения
Показать ответ
Верный ответ: C. Если задача ориентирована на практическое прогнозирование, модель прежде всего оценивают по тому, насколько хорошо она предсказывает целевой показатель; прозрачность объяснения становится вторичной.
При оценке линейной регрессии для каждого объекта сравнивают фактическое значение целевой переменной y с прогнозом модели ŷ. Какой показатель измеряет среднюю величину ошибки в исходных единицах, усредняя модули разностей |y − ŷ| по всем объектам?
AСредняя абсолютная ошибка (MAE)
BДоля объектов, для которых прогноз полностью совпал с фактическим значением
CСредняя квадратичная ошибка (MSE)
DСумма ошибок со знаками, которая может взаимно сократиться
Показать ответ
Верный ответ: A. MAE усредняет абсолютные отклонения прогнозов от фактических значений, поэтому показывает типичный размер ошибки без взаимного погашения положительных и отрицательных отклонений.