सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

3
यदि समायोजित आर-वर्ग बेहतर मॉडल की भविष्यवाणी करता है तो आर-वर्ग को आर-वर्ग से कम क्यों समायोजित किया जाता है?
जहां तक ​​मैं समझता हूं, बताता है कि मॉडल अवलोकन को कितनी अच्छी तरह से भविष्यवाणी करता है। समायोजित आर 2 वह है जो अधिक टिप्पणियों (या स्वतंत्रता की डिग्री) को ध्यान में रखता है। तो, समायोजित आर 2 मॉडल को बेहतर ढंग से भविष्यवाणी करता है? फिर यह आर …

1
क्या सांख्यिकीय तरीके पुरातन हैं और उन्हें पाठ्यपुस्तकों से हटा दिया जाना चाहिए? [बन्द है]
जैसा कि वर्तमान में खड़ा है, यह प्रश्न हमारे प्रश्नोत्तर प्रारूप के लिए एक अच्छा फिट नहीं है। हम तथ्यों, संदर्भों या विशेषज्ञता के आधार पर उत्तर दिए जाने की अपेक्षा करते हैं, लेकिन इस प्रश्न पर बहस, बहस, मतदान या विस्तारित चर्चा की संभावना होगी। यदि आपको लगता है …

1
Ggplot प्रतिगमन के लिए विश्वास अंतराल की गणना कैसे करता है?
R प्लॉटिंग पैकेज ggplot2 में संबंधित विश्वास बैंड के साथ एक प्रतिगमन रेखा (या वक्र) की साजिश रचने के लिए stat_smooth नामक एक भयानक कार्य है । हालाँकि मुझे यह पता लगाने में मुश्किल समय आ रहा है कि यह आत्मविश्वास बैंड कैसे उत्पन्न होता है, प्रतिगमन लाइन (या "विधि") …

2
एक बहुभिन्नरूपी गाऊसी के सहवर्ती पश्च वितरण का अनुमान
मुझे कुछ नमूनों के साथ एक बीवरिएट गौसियन के वितरण को "सीखना" चाहिए, लेकिन पूर्व वितरण पर एक अच्छी परिकल्पना है, इसलिए मैं बायेसियन दृष्टिकोण का उपयोग करना चाहूंगा। मैंने अपने पूर्व को परिभाषित किया: / mathbf {\ _ mu_0} = \ start {शुरू} bmatrix} 0 \\ 0 \ end …

2
एक सामान्य वितरण के मापदंडों का अनुमान लगाना: औसत के बजाय मंझला?
सामान्य वितरण के मापदंडों का अनुमान लगाने के लिए सामान्य दृष्टिकोण का मतलब और नमूना मानक विचलन / विचरण का उपयोग करना है। हालांकि, अगर कुछ आउटलेयर हैं, तो माध्यिका और माध्यिका से मध्य विचलन बहुत अधिक मजबूत होना चाहिए, है ना? कुछ डेटा सेट पर मैंने कोशिश की, सामान्य …

1
आर का उपयोग करके पॉइसन प्रक्रिया का अनुमान कैसे लगाएं? (या: NHPoisson पैकेज का उपयोग कैसे करें?)
मेरे पास घटनाओं का डेटाबेस (यानी तारीखों का एक चर) और संबद्ध कोवरिएट्स हैं। गैर-स्थिर पॉइज़न प्रक्रिया द्वारा घटनाओं को उत्पन्न किया जाता है, जिसमें पैरामीटर कुछ कोवरिएट का अज्ञात (लेकिन संभवतः रैखिक) फ़ंक्शन होता है। मुझे लगता है कि NHPoisson पैकेज सिर्फ इस उद्देश्य के लिए मौजूद है; लेकिन …

4
क्या द्विआधारी डेटा के प्रतिगमन मॉडलिंग के लिए लॉगिट फ़ंक्शन हमेशा सबसे अच्छा है?
मैं इस समस्या के बारे में सोच रहा हूं। द्विआधारी डेटा मॉडलिंग के लिए सामान्य लॉजिस्टिक फ़ंक्शन है: हालांकि logit समारोह है, जो एक एस के आकार की अवस्था है, हमेशा डेटा मॉडलिंग के लिए सबसे अच्छा है? हो सकता है कि आपके पास यह विश्वास करने का कारण हो …

1
Gbm पैकेज में आउटपुट शब्दों का अर्थ?
मैं वर्गीकरण के लिए gbm पैकेज का उपयोग कर रहा हूं। जैसी कि उम्मीद थी, परिणाम अच्छे हैं। लेकिन मैं क्लासिफायर के आउटपुट को समझने की कोशिश कर रहा हूं। आउटपुट में पाँच शब्द हैं। `Iter TrainDeviance ValidDeviance StepSize Improve` क्या कोई भी प्रत्येक शब्द का अर्थ समझा सकता है, …

2
एक सहसंयोजक संरचना निर्दिष्ट करना: पेशेवरों और विपक्ष
एक जीएलएम में एक सहसंयोजक संरचना को निर्दिष्ट करने के क्या लाभ हैं (बजाय सहसंयोजक मैट्रिक्स में सभी ऑफ-विकर्ण प्रविष्टियों को शून्य के रूप में माना जाता है)? यह दर्शाने के अलावा कि किसी को डेटा के बारे में क्या पता है, वह करता है फिट की अच्छाई में सुधार? …

1
हम विचरण को स्थिर क्यों करते हैं?
मैं कागले निबंध ईवल विधि को पढ़ते हुए परिवर्तन को स्थिर करते हुए आया । वे अपने मतलब लेने से पहले कप्पा मूल्यों को बदलने और फिर उन्हें वापस बदलने के लिए एक विचरण स्थिरीकरण परिवर्तन का उपयोग करते हैं। विचरण स्थिरीकरण पर विकी को पढ़ने के बाद भी मैं …

3
पूर्वानुमान त्रुटि का एक निश्चित माप का उपयोग क्यों करें (जैसे MAD) दूसरे के विपरीत (जैसे MSE)?
MAD = मीन एब्सोल्यूट डिविएशन MSE = मीन स्क्वेर्ड एरर मैंने विभिन्न स्थानों से सुझाव देखे हैं कि MSE का उपयोग कुछ अवांछनीय गुणों के बावजूद किया जाता है (उदाहरण के लिए http://www.stat.nus.edu.sg/~staxyc/T12.pdf , जो p8 पर बताता है "यह आमतौर पर माना जाता है कि MAD MSE से बेहतर …
15 forecasting  error  mse  mae 

1
मिश्रित मॉडल परिणामों को विज़ुअलाइज़ करना
एक समस्या जो मैंने हमेशा मिश्रित मॉडल के साथ की है, वह डेटा विज़ुअलाइज़ेशन का पता लगा रही है - उस तरह की जो एक पेपर या पोस्टर पर समाप्त हो सकती है - एक बार परिणाम आने के बाद। अभी, मैं एक फॉर्मूले के साथ एक पॉइज़न मिश्रित प्रभाव …

7
बेतरतीब जंगल उग आए हैं
मैं scikits- सीखने में रैंडम फ़ॉरेस्ट रिग्रेशन का उपयोग करने की कोशिश कर रहा हूं। समस्या यह है कि मुझे वास्तव में उच्च परीक्षण त्रुटि मिल रही है: train MSE, 4.64, test MSE: 252.25. यह मेरा डेटा कैसा दिखता है: (नीला: वास्तविक डेटा, हरा: अनुमानित): मैं प्रशिक्षण के लिए 90% …

1
त्रुटियों-इन-चर प्रतिगमन: क्या यह तीन साइटों से पूल डेटा के लिए मान्य है?
मेरे पास हाल ही में एक क्लाइंट मेरे पास बूटस्ट्रैप विश्लेषण करने के लिए आया था क्योंकि एक एफडीए समीक्षक ने कहा कि उनकी त्रुटियों में परिवर्तनशील प्रतिगमन अमान्य था क्योंकि जब साइटों के डेटा को पूल करते हुए विश्लेषण में तीन साइटों से पूलिंग डेटा शामिल होते हैं, जहां …

3
सांख्यिकीय यादृच्छिकता के बारे में कुछ प्रश्न
से विकिपीडिया के सांख्यिकीय randoness : वैश्विक यादृच्छिकता और स्थानीय यादृच्छिकता अलग हैं। यादृच्छिकता की अधिकांश दार्शनिक अवधारणाएं वैश्विक हैं - क्योंकि वे इस विचार पर आधारित हैं कि "लंबे समय में" एक अनुक्रम वास्तव में यादृच्छिक दिखता है, भले ही कुछ उप-क्रम यादृच्छिक न दिखें। उदाहरण के लिए, पर्याप्त …

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.