न्यूनतम वर्ग प्रतिगमन

गणनाओं की तुलना करें

डाउनलोड

इस गणना के लिए आपके इनपुट और परिणाम, साथ ही आपके द्वारा तुलना की गई कोई भी अतिरिक्त गणना शामिल है।

बिखरे हुए डेटा बिंदुओं में एक रेखा फिट करना

न्यूनतम वर्ग प्रतिगमन डेटा बिंदुओं के एक समूह के लिए सबसे उपयुक्त एकमात्र रेखा ज्ञात करता है। x, y युग्मों की एक सूची दर्ज करें — प्रति पंक्ति एक — और यह कैलकुलेटर रेखा की ढलान और इंटरसेप्ट, साथ ही बिंदु वास्तव में उस रेखा का कितनी मजबूती से अनुसरण करते हैं, यह ज्ञात करता है।

सूत्र

m=nxyxynx2(x)2\vC{m} = \frac{n\sum{xy} - \sum{x}\sum{y}}{n\sum{x^2} - \left(\sum{x}\right)^2} b=ymxn\vC{b} = \frac{\sum{y} - m\sum{x}}{n}

जहां mm ढलान है, bb इंटरसेप्ट है, और nn डेटा बिंदुओं की संख्या है — साथ में, वे रेखा y=mx+by = mx + b का वर्णन करते हैं जो प्रत्येक बिंदु से रेखा तक की कुल वर्गित दूरी को न्यूनतम करती है।

हल किया गया उदाहरण

(1, 1), (2, 2), और (3, 4) के माध्यम से एक रेखा फिट करना:

    1. m=3(17)6(7)3(14)62=51424236=96=1.5m = \frac{3(17) - 6(7)}{3(14) - 6^2} = \frac{51 - 42}{42 - 36} = \frac{9}{6} = \vC{1.5}

    2. b=71.5(6)3=793=0.667b = \frac{7 - 1.5(6)}{3} = \frac{7 - 9}{3} = \vC{-0.667} — फिट की गई रेखा इसलिए y=1.5x0.667y = 1.5x - 0.667 है, जिसका सहसंबंध गुणांक लगभग 0.980.98 है।

ध्यान रखने योग्य मुख्य बातें

  • एक मजबूत सहसंबंध गुणांक का मतलब जरूरी नहीं कि x वास्तव में y का कारण बनता है। दो चर मजबूती से सहसंबद्ध हो सकते हैं क्योंकि एक वास्तव में दूसरे को प्रभावित करता है, क्योंकि दोनों एक तीसरे कारक द्वारा संचालित होते हैं, या एक छोटे डेटासेट में केवल संयोग से — सहसंबंध एक रैखिक संबंध की मजबूती का वर्णन करता है, उसके पीछे के कारण का नहीं।
  • यह विधि मानती है कि वास्तविक संबंध रैखिक है, जो हमेशा सही धारणा नहीं होती। यदि बिंदुओं का एक समूह वास्तव में एक वक्र का अनुसरण करता है, तो उसके माध्यम से एक सीधी रेखा को जबरदस्ती फिट करने से एक तकनीकी रूप से “सबसे अच्छा फिट” रेखा बन सकती है जो फिर भी डेटा का खराब वर्णन करती है — फिट पर भरोसा करने से पहले बिंदुओं को दृष्टिगत रूप से प्लॉट करना अच्छा अभ्यास है।
  • एक अकेला असामान्य बिंदु (आउटलायर) फिट की गई रेखा को असमान रूप से अपनी ओर खींच सकता है। क्योंकि न्यूनतम वर्ग वर्गित दूरियों को न्यूनतम करता है, सामान्य प्रवृत्ति से दूर एक बिंदु उसके पास के एक बिंदु की तुलना में फिट में कहीं अधिक योगदान देता है — एक अत्यधिक आउटलायर वाला एक छोटा डेटासेट इसके प्रति विशेष रूप से संवेदनशील होता है।
  • अधिक डेटा बिंदु आमतौर पर एक अधिक विश्वसनीय फिट उत्पन्न करते हैं, बाकी सब समान रहने पर। केवल 3-4 बिंदुओं (जैसा कि हल किए गए उदाहरण में है) के माध्यम से फिट की गई एक रेखा ठोस दिख सकती है लेकिन दर्जनों बिंदुओं में मापे गए समान संबंध की तुलना में कहीं अधिक अनिश्चितता रखती है — अकेले सहसंबंध की मजबूती यह नहीं दर्शाती कि वास्तव में कितना डेटा फिट का समर्थन करता है।

आम गलतियाँ

  • एक उच्च सहसंबंध गुणांक को कार्य-कारण के प्रमाण के रूप में मानना। एक मजबूत r-मान केवल यह दर्शाता है कि बिंदु एक रेखा के चारों ओर मजबूती से समूहित हैं — यह इस बारे में कुछ नहीं बताता कि क्या एक चर वास्तव में दूसरे में बदलाव का कारण बनता है।
  • वास्तव में वक्र वाले डेटा में एक सीधी रेखा फिट करना। न्यूनतम वर्ग हमेशा एक ढलान और इंटरसेप्ट लौटाता है, भले ही एक रैखिक फिट अंतर्निहित पैटर्न का खराब वर्णन करे — परिणाम पर भरोसा करने से पहले पहले बिंदुओं को प्लॉट करें, या जांचें कि क्या सहसंबंध गुणांक आश्चर्यजनक रूप से कम है।
  • बहुत कम डेटा बिंदुओं का उपयोग करना और फिट को विश्वसनीय मानना। केवल 3-4 बिंदुओं के माध्यम से एक रेखा ठोस दिख सकती है लेकिन दर्जनों बिंदुओं में मापे गए समान संबंध की तुलना में कहीं अधिक अनिश्चितता रखती है।
  • एक अकेले आउटलायर को बिना ध्यान दिए फिट पर हावी होने देना। क्योंकि न्यूनतम वर्ग वर्गित दूरियों को न्यूनतम करता है, एक दूर का बिंदु पूरी रेखा को अपनी ओर खींच सकता है — यह जांचना उचित है कि क्या किसी असामान्य बिंदु को हटाने से परिणाम काफी हद तक बदल जाता है।

जानने योग्य बातें

  • कई बिंदुओं के माध्यम से एक ट्रेंड रेखा फिट करने के बजाय दो ज्ञात बिंदुओं के बीच एक मान का अनुमान लगाने की आवश्यकता है? रैखिक प्रक्षेप कैलकुलेटर उस अधिक प्रत्यक्ष मामले को कवर करता है।
  • देखना चाहते हैं कि एक विशिष्ट मान डेटासेट के समग्र प्रसार से कैसे तुलना करता है? Z-स्कोर कैलकुलेटर बिल्कुल यही मापता है।
  • व्यापक सारांश आंकड़ों के लिए समान संख्याओं की सूची के साथ काम कर रहे हैं? सांख्यिकी कैलकुलेटर माध्य, माध्यिका, और मानक विचलन को कवर करता है।

स्रोत: सरल रैखिक प्रतिगमन.

अक्सर पूछे जाने वाले प्रश्न

न्यूनतम वर्ग प्रतिगमन (Least Squares Regression) क्या है?

न्यूनतम वर्ग प्रतिगमन डेटा बिंदुओं के बिखराव के लिए सबसे उपयुक्त एकल सीधी रेखा ज्ञात करता है, प्रत्येक बिंदु और रेखा के बीच वर्गित ऊर्ध्वाधर दूरियों के योग को न्यूनतम करके। यह दो चरों के बीच एक रैखिक संबंध का वर्णन करने की मानक विधि है।

ढलान और इंटरसेप्ट का क्या मतलब है?

ढलान बताता है कि x में हर 1-इकाई वृद्धि के लिए y कितना बदलता है -- 2 की ढलान का मतलब है कि जब भी x 1 बढ़ता है तो y 2 बढ़ता है। इंटरसेप्ट रेखा का अनुमानित y मान है जब x शून्य है, जो वह स्थान है जहां रेखा ऊर्ध्वाधर अक्ष को पार करती है।

सहसंबंध गुणांक (r) मुझे क्या बताता है?

सहसंबंध गुणांक -1 से 1 तक होता है और मापता है कि बिंदु फिट की गई रेखा के चारों ओर कितने कसकर समूहित होते हैं। 1 के करीब मान एक मजबूत सकारात्मक संबंध का मतलब है (जैसे-जैसे x बढ़ता है, y भी विश्वसनीय रूप से बढ़ता है), -1 के करीब एक मजबूत नकारात्मक संबंध का मतलब है, और 0 के करीब का मतलब है बहुत कम या कोई रैखिक संबंध नहीं। R-वर्ग (r²) बस r को अपने आप से गुणा किया गया है, और अक्सर इसे "y में भिन्नता का प्रतिशत जो x द्वारा समझाया जाता है" के रूप में पढ़ा जाता है।

क्या एक मजबूत सहसंबंध का मतलब है कि x, y का कारण बनता है?

नहीं -- सहसंबंध केवल यह मापता है कि दो चर कितनी मजबूती से एक साथ चलते हैं, यह नहीं कि क्यों। एक मजबूत सहसंबंध वास्तविक कार्य-कारण, दोनों चरों को प्रभावित करने वाले एक साझा अंतर्निहित कारण, या सामान्य संयोग को दर्शा सकता है, खासकर एक छोटे डेटासेट में। अकेले एक उच्च सहसंबंध गुणांक को एक कारण संबंध के प्रमाण के रूप में न लें।

अगर मेरा डेटा वास्तव में एक सीधी रेखा का पालन नहीं करता है तो क्या होगा?

न्यूनतम वर्ग प्रतिगमन हमेशा एक सीधी रेखा फिट करता है, यहां तक कि उस डेटा के लिए भी जो वास्तव में एक वक्र का पालन करता है -- यह फिर भी एक ढलान, इंटरसेप्ट, और सहसंबंध गुणांक लौटाएगा, लेकिन वे संबंध का खराब वर्णन कर सकते हैं। पहले अपने बिंदुओं को प्लॉट करना, या यह जांचना कि क्या सहसंबंध गुणांक अप्रत्याशित रूप से कम है, यह संकेत दे सकता है कि आपके डेटा के लिए एक रैखिक फिट गलत उपकरण है।

अपनी उम्र की पुष्टि करें

खाता बनाने के लिए, कृपया अपना जन्म महीना और वर्ष बताएं।