Подбор Линии для Разбросанных Точек Данных
Регрессия методом наименьших квадратов находит единственную прямую линию, которая наилучшим образом соответствует разбросу точек данных. Введите список пар x, y — по одной на строку — и этот калькулятор найдёт наклон и точку пересечения линии, а также насколько точно точки на самом деле следуют этой линии.
Формула
где — наклон, — точка пересечения, а — количество точек данных — вместе они описывают линию , которая минимизирует общее квадратичное расстояние от каждой точки до линии.
Решённый Пример
Построение линии через точки (1, 1), (2, 2) и (3, 4):
- — таким образом, подобранная линия — , с коэффициентом корреляции примерно .
Ключевые Факторы, Которые Следует Учитывать
- Сильный коэффициент корреляции не обязательно означает, что x реально вызывает y. Две переменные могут быть сильно коррелированы, потому что одна действительно влияет на другую, потому что обе определяются третьим фактором, или просто по совпадению в небольшом наборе данных — корреляция описывает силу линейной связи, а не причину, стоящую за ней.
- Этот метод предполагает, что истинная зависимость линейна, что не всегда верное предположение. Если разброс точек на самом деле следует по кривой, принудительное проведение прямой линии через него может дать технически «наилучшую» линию, которая всё равно плохо описывает данные — визуально построить точки перед тем, как доверять подбору, — хорошая практика.
- Одна необычная точка (выброс) может непропорционально сильно притянуть подобранную линию к себе. Поскольку метод наименьших квадратов минимизирует КВАДРАТЫ расстояний, точка, далёкая от общей тенденции, вносит гораздо больший вклад в подбор, чем близкая к ней точка — небольшой набор данных с одним экстремальным выбросом особенно чувствителен к этому.
- Больше точек данных обычно даёт более надёжный подбор, при прочих равных. Линия, подобранная всего по 3-4 точкам (как в разобранном примере), может выглядеть убедительно, но несёт гораздо больше неопределённости, чем та же зависимость, измеренная по десяткам точек — сама по себе сила корреляции не показывает, сколько данных на самом деле подтверждает подбор.
Частые Ошибки
- Рассмотрение высокого коэффициента корреляции как доказательства причинно-следственной связи. Сильное значение r показывает только то, что точки тесно группируются вокруг линии — оно ничего не говорит о том, вызывает ли одна переменная реальные изменения в другой.
- Подбор прямой линии для данных, которые на самом деле имеют кривую форму. Метод наименьших квадратов всегда возвращает наклон и точку пересечения, даже когда линейный подбор плохо описывает лежащую в основе закономерность — сначала постройте точки визуально или проверьте, не является ли коэффициент корреляции неожиданно низким, прежде чем доверять результату.
- Использование слишком малого количества точек данных и рассмотрение подбора как надёжного. Линия всего по 3-4 точкам может выглядеть убедительно, но несёт гораздо больше неопределённости, чем та же зависимость, измеренная по десяткам точек.
- Позволение одному выбросу незаметно доминировать в подборе. Поскольку метод наименьших квадратов минимизирует квадраты расстояний, одна далёкая точка может притянуть к себе всю линию — стоит проверить, существенно ли меняется результат при удалении необычной точки.
Полезно Знать
- Нужно оценить значение между двумя известными точками вместо подбора линии тренда по многим точкам? Калькулятор Линейной Интерполяции охватывает этот более прямой случай.
- Хотите увидеть, как одно конкретное значение соотносится с общим разбросом набора данных? Калькулятор Z-Оценки измеряет именно это.
- Работаете с тем же списком чисел для более широкой сводной статистики? Калькулятор Статистики охватывает среднее значение, медиану, и стандартное отклонение.