Калькулятор лінійної регресії

Проста лінійна регресія — статистичний метод, який будує пряму лінію y = mx + b, що найкраще описує зв'язок між двома змінними X і Y. Обчислення виконуються методом найменших квадратів: параметри лінії підбираються так, щоб мінімізувати суму квадратів відхилень реальних точок від прямої. Метод широко застосовується в науці, економіці, інженерії та аналізі даних для виявлення тенденцій і прогнозування.

Даний інструмент реалізує науково обґрунтований підхід до обчислень, що базується на перевірених математичних методах і стандартних формулах. Усі розрахунки виконуються у реальному часі безпосередньо у браузері — без відправки даних на сервер і без необхідності встановлювати додаткове програмне забезпечення. Інтерфейс оптимізований для зручного введення параметрів, відображення результатів з необхідною точністю та покрокових пояснень застосованих формул.

Розрахунок лінійної регресії

Формули методу найменших квадратів

Рівняння прямої регресії

y = m·x + b

Нахил (m) та зсув (b)

x̄ = Σxi / n (середнє X) ȳ = Σyi / n (середнє Y) m = Σ((xi − x̄)(yi − ȳ)) / Σ((xi − x̄)²) b = ȳ − m·x̄

Коефіцієнт детермінації R²

r = Σ((xi−x̄)(yi−ȳ)) / √( Σ(xi−x̄)² · Σ(yi−ȳ)² ) R² = r² R² ∈ [0, 1]: чим ближче до 1, тим краще лінія пояснює дані

Важливі застереження

  • Мінімум точок — потрібно щонайменше 3 пари (X, Y) для змістовної оцінки
  • Лінійність — метод шукає найкращу пряму лінію; якщо реальний зв'язок нелінійний, результат буде оманливим
  • Екстраполяція — прогнози за межами діапазону спостережених X ненадійні
  • Викиди — аномальні точки можуть суттєво спотворити нахил і зсув
  • Кореляція ≠ причинність — сильний R² не доводить причинно-наслідковий зв'язок

Приклади розв'язання

Покрокові задачі

Приклад 1: Дано пари X = {1, 2, 3, 4, 5}, Y = {2, 4, 5, 4, 5}. Знайдіть рівняння регресії та R².

Розв'язання:

x̄ = (1+2+3+4+5)/5 = 3; ȳ = (2+4+5+4+5)/5 = 4

Σ((xi−x̄)(yi−ȳ)) = (−2)(−2) + (−1)(0) + (0)(1) + (1)(0) + (2)(1) = 4+0+0+0+2 = 6

Σ(xi−x̄)² = 4+1+0+1+4 = 10

m = 6 / 10 = 0,6; b = 4 − 0,6×3 = 2,2

Σ(yi−ȳ)² = 4+0+1+0+1 = 6; R² = 6² / (10×6) = 36/60 = 0,6

Відповідь: y = 0,6x + 2,2; R² = 0,6 (модель пояснює 60% варіації Y)

Приклад 2: Години навчання X = {2, 4, 6, 8, 10} і бали за тест Y = {65, 70, 75, 85, 95}. Знайдіть лінію регресії.

Розв'язання:

x̄ = 6; ȳ = 78

Σ((xi−x̄)(yi−ȳ)) = (−4)(−13)+(−2)(−8)+(0)(−3)+(2)(7)+(4)(17) = 52+16+0+14+68 = 150

Σ(xi−x̄)² = 16+4+0+4+16 = 40

m = 150/40 = 3,75; b = 78 − 3,75×6 = 55,5

Σ(yi−ȳ)² = 169+64+9+49+289 = 580; R² = 150²/(40×580) = 22500/23200 ≈ 0,970

Відповідь: y = 3,75x + 55,5; R² ≈ 0,97 (дуже сильна лінійна залежність)

Приклад 3: Температура X = {15, 20, 25, 30} °C і продажі морозива Y = {200, 240, 300, 360} порцій. Знайдіть модель і спрогнозуйте продажі при X = 35 °C.

Розв'язання:

x̄ = 22,5; ȳ = 275

Σ((xi−x̄)(yi−ȳ)) = (−7,5)(−75)+(−2,5)(−35)+(2,5)(25)+(7,5)(85) = 562,5+87,5+62,5+637,5 = 1350

Σ(xi−x̄)² = 56,25+6,25+6,25+56,25 = 125

m = 1350/125 = 10,8; b = 275 − 10,8×22,5 = 32

Σ(yi−ȳ)² = 5625+1225+625+7225 = 14700; R² = 1350²/(125×14700) = 1822500/1837500 ≈ 0,992

Прогноз при X = 35: y = 10,8×35 + 32 = 378 + 32 = 410

Відповідь: y = 10,8x + 32; R² ≈ 0,992. Прогноз 410 порцій при 35°C — це вже екстраполяція (за межами діапазону 15–30), тому результат орієнтовний.

Практичне значення та контекст

Де застосовується

Лінійна регресія — один з найпоширеніших інструментів статистичного аналізу. Студенти застосовують її під час вивчення статистики та економетрики для перевірки домашніх завдань. Дослідники використовують метод найменших квадратів для виявлення тенденцій у експериментальних даних — від фізики до соціології. У бізнесі регресію застосовують для прогнозування продажів, аналізу залежності витрат на рекламу від доходу, оцінки трендів цін. У науці про дані лінійна регресія — базова модель машинного навчання, яка часто слугує еталоном для порівняння складніших алгоритмів. Простота обчислень і інтерпретованість роблять цей метод незамінним первинним інструментом аналізу даних.

Часті запитання (FAQ)

Що робить лінійна регресія?
Проста лінійна регресія знаходить пряму лінію y = mx + b, яка найкраще описує залежність між двома змінними X і Y. «Найкраще» означає, що сума квадратів відхилень (залишків) фактичних точок від лінії є мінімальною — це так званий метод найменших квадратів.
Як обчислюються нахил (m) та зсув (b)?
Нахил m = Σ((xi − x̄)(yi − ȳ)) / Σ((xi − x̄)²), де x̄ і ȳ — середні значення X і Y. Зсув (перетин з віссю Y) обчислюється як b = ȳ − m·x̄. Ці формули випливають з мінімізації суми квадратів залишків.
Що означає коефіцієнт детермінації R²?
R² показує частку дисперсії Y, яку пояснює лінійна модель, і набуває значень від 0 до 1. R² = 1 означає ідеальне узгодження — усі точки лежать точно на лінії. R² = 0 означає, що лінія не пояснює жодної варіації Y (модель не кращa за просте середнє). Значення ближче до 1 свідчать про сильнішу лінійну залежність.
Чому небезпечно екстраполювати далеко за межі даних?
Регресійна лінія побудована лише на спостережених значеннях X. За межами цього діапазону залежність може бути нелінійною або взагалі іншою, тож прогнози (екстраполяція) стають ненадійними. Чим далі точка прогнозу від діапазону вхідних даних, тим вища невизначеність і ризик хибного результату.
Чим кореляція відрізняється від регресії?
Кореляція (коефіцієнт Пірсона r) вимірює силу й напрямок лінійного зв'язку між двома змінними, не розрізняючи, яка з них залежна. Регресія йде далі — вона будує конкретну математичну модель (рівняння прямої), яку можна використовувати для прогнозування значень Y за X.