बिखरे हुए डेटा बिंदुओं में एक रेखा फिट करना
न्यूनतम वर्ग प्रतिगमन डेटा बिंदुओं के एक समूह के लिए सबसे उपयुक्त एकमात्र रेखा ज्ञात करता है। x, y युग्मों की एक सूची दर्ज करें — प्रति पंक्ति एक — और यह कैलकुलेटर रेखा की ढलान और इंटरसेप्ट, साथ ही बिंदु वास्तव में उस रेखा का कितनी मजबूती से अनुसरण करते हैं, यह ज्ञात करता है।
सूत्र
जहां ढलान है, इंटरसेप्ट है, और डेटा बिंदुओं की संख्या है — साथ में, वे रेखा का वर्णन करते हैं जो प्रत्येक बिंदु से रेखा तक की कुल वर्गित दूरी को न्यूनतम करती है।
हल किया गया उदाहरण
(1, 1), (2, 2), और (3, 4) के माध्यम से एक रेखा फिट करना:
-
-
— फिट की गई रेखा इसलिए है, जिसका सहसंबंध गुणांक लगभग है।
ध्यान रखने योग्य मुख्य बातें
- एक मजबूत सहसंबंध गुणांक का मतलब जरूरी नहीं कि x वास्तव में y का कारण बनता है। दो चर मजबूती से सहसंबद्ध हो सकते हैं क्योंकि एक वास्तव में दूसरे को प्रभावित करता है, क्योंकि दोनों एक तीसरे कारक द्वारा संचालित होते हैं, या एक छोटे डेटासेट में केवल संयोग से — सहसंबंध एक रैखिक संबंध की मजबूती का वर्णन करता है, उसके पीछे के कारण का नहीं।
- यह विधि मानती है कि वास्तविक संबंध रैखिक है, जो हमेशा सही धारणा नहीं होती। यदि बिंदुओं का एक समूह वास्तव में एक वक्र का अनुसरण करता है, तो उसके माध्यम से एक सीधी रेखा को जबरदस्ती फिट करने से एक तकनीकी रूप से “सबसे अच्छा फिट” रेखा बन सकती है जो फिर भी डेटा का खराब वर्णन करती है — फिट पर भरोसा करने से पहले बिंदुओं को दृष्टिगत रूप से प्लॉट करना अच्छा अभ्यास है।
- एक अकेला असामान्य बिंदु (आउटलायर) फिट की गई रेखा को असमान रूप से अपनी ओर खींच सकता है। क्योंकि न्यूनतम वर्ग वर्गित दूरियों को न्यूनतम करता है, सामान्य प्रवृत्ति से दूर एक बिंदु उसके पास के एक बिंदु की तुलना में फिट में कहीं अधिक योगदान देता है — एक अत्यधिक आउटलायर वाला एक छोटा डेटासेट इसके प्रति विशेष रूप से संवेदनशील होता है।
- अधिक डेटा बिंदु आमतौर पर एक अधिक विश्वसनीय फिट उत्पन्न करते हैं, बाकी सब समान रहने पर। केवल 3-4 बिंदुओं (जैसा कि हल किए गए उदाहरण में है) के माध्यम से फिट की गई एक रेखा ठोस दिख सकती है लेकिन दर्जनों बिंदुओं में मापे गए समान संबंध की तुलना में कहीं अधिक अनिश्चितता रखती है — अकेले सहसंबंध की मजबूती यह नहीं दर्शाती कि वास्तव में कितना डेटा फिट का समर्थन करता है।
आम गलतियाँ
- एक उच्च सहसंबंध गुणांक को कार्य-कारण के प्रमाण के रूप में मानना। एक मजबूत r-मान केवल यह दर्शाता है कि बिंदु एक रेखा के चारों ओर मजबूती से समूहित हैं — यह इस बारे में कुछ नहीं बताता कि क्या एक चर वास्तव में दूसरे में बदलाव का कारण बनता है।
- वास्तव में वक्र वाले डेटा में एक सीधी रेखा फिट करना। न्यूनतम वर्ग हमेशा एक ढलान और इंटरसेप्ट लौटाता है, भले ही एक रैखिक फिट अंतर्निहित पैटर्न का खराब वर्णन करे — परिणाम पर भरोसा करने से पहले पहले बिंदुओं को प्लॉट करें, या जांचें कि क्या सहसंबंध गुणांक आश्चर्यजनक रूप से कम है।
- बहुत कम डेटा बिंदुओं का उपयोग करना और फिट को विश्वसनीय मानना। केवल 3-4 बिंदुओं के माध्यम से एक रेखा ठोस दिख सकती है लेकिन दर्जनों बिंदुओं में मापे गए समान संबंध की तुलना में कहीं अधिक अनिश्चितता रखती है।
- एक अकेले आउटलायर को बिना ध्यान दिए फिट पर हावी होने देना। क्योंकि न्यूनतम वर्ग वर्गित दूरियों को न्यूनतम करता है, एक दूर का बिंदु पूरी रेखा को अपनी ओर खींच सकता है — यह जांचना उचित है कि क्या किसी असामान्य बिंदु को हटाने से परिणाम काफी हद तक बदल जाता है।
जानने योग्य बातें
- कई बिंदुओं के माध्यम से एक ट्रेंड रेखा फिट करने के बजाय दो ज्ञात बिंदुओं के बीच एक मान का अनुमान लगाने की आवश्यकता है? रैखिक प्रक्षेप कैलकुलेटर उस अधिक प्रत्यक्ष मामले को कवर करता है।
- देखना चाहते हैं कि एक विशिष्ट मान डेटासेट के समग्र प्रसार से कैसे तुलना करता है? Z-स्कोर कैलकुलेटर बिल्कुल यही मापता है।
- व्यापक सारांश आंकड़ों के लिए समान संख्याओं की सूची के साथ काम कर रहे हैं? सांख्यिकी कैलकुलेटर माध्य, माध्यिका, और मानक विचलन को कवर करता है।