सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

2
मॉडल के क्रॉस सत्यापन भविष्यवाणी त्रुटि के संदर्भ में आगे चयन / पिछड़े उन्मूलन पर LASSO की श्रेष्ठता
मैंने एक मूल पूर्ण मॉडल का उपयोग करके तीन कम किए गए मॉडल प्राप्त किए आगे का चयन पिछड़ा उन्मूलन L1 दंड तकनीक (LASSO) फॉरवर्ड सिलेक्शन / बैकवर्ड एलिमिनेशन का उपयोग कर प्राप्त किए गए मॉडल के लिए, मैंने उपलब्ध CVlmपैकेज में उपयोग करके भविष्यवाणी की त्रुटि का क्रॉस वैरिफाइड …

4
यदि अंतर अंतर लगभग 0 है तो एक टी-टेस्ट सांख्यिकीय रूप से महत्वपूर्ण कैसे हो सकता है?
मैं यह बताने के लिए 2 आबादी के डेटा की तुलना करने की कोशिश कर रहा हूं कि क्या उपचार के बीच का अंतर सांख्यिकीय रूप से महत्वपूर्ण है। डेटा सेट को आम तौर पर दो सेटों के बीच बहुत कम अंतर के साथ वितरित किया जाता है। औसत अंतर …

4
तंत्रिका नेटवर्क, ऑटो.रिमा और ईटीएस के साथ आर-सीरीज़ का पूर्वानुमान
मैंने समय श्रृंखला का पूर्वानुमान करने के लिए तंत्रिका नेटवर्क का उपयोग करने के बारे में थोड़ा सुना है। मैं कैसे तुलना कर सकता हूं, मेरी समय-श्रृंखला (दैनिक खुदरा डेटा) के पूर्वानुमान के लिए कौन सी विधि बेहतर है: ऑटो.रिमा (एक्स), ईटीएस (एक्स) या नेनेटार (एक्स)। मैं एआईसी या बीआईसी …

1
प्रशिक्षण और परीक्षण सेट का उपयोग करके प्रतिगमन मॉडल के प्रदर्शन का मूल्यांकन?
मैं अक्सर परीक्षण सेट को आयोजित करके और प्रशिक्षण सेट पर एक मॉडल को प्रशिक्षित करके एक वर्गीकरण मॉडल के प्रदर्शन का मूल्यांकन करने के बारे में सुनता हूं। फिर 2 वैक्टर बनाना, एक भविष्यवाणी मूल्यों के लिए और एक सच्चे मूल्यों के लिए। स्पष्ट रूप से एक तुलना करने …

2
होल्म-बोन्फेरोनी से अधिक बोन्फेर्रोनी का उपयोग क्यों करें?
मैं देख सकता हूं कि आप बोनबर्गाई सुधार पर होचबर्ग पद्धति जैसी अधिक शक्तिशाली विधि का उपयोग क्यों नहीं कर सकते हैं, क्योंकि उनके पास इस मामले में परिकल्पना की स्वतंत्रता जैसी अतिरिक्त धारणाएं हो सकती हैं, लेकिन मुझे समझ नहीं आता कि आप क्यों? कभी भी होल्म के क्रमिक …

1
आप मान-व्हिटनी परीक्षण की रिपोर्ट कैसे करते हैं?
मैं अपना शोध प्रबंध कर रहा हूं, और मैं कई परीक्षण कर रहा हूं। क्रुस्कल-वालिस परीक्षण का उपयोग करने के बाद, मैं आमतौर पर इस तरह के परिणाम की रिपोर्ट करता हूं: एक महत्वपूर्ण अंतर नहीं है (χ2(2)=7.448,p=.024)(χ(2)2=7.448,p=.024)(\chi^2_{(2)}=7.448, p=.024) के माध्यम के बीच ... लेकिन अब मैंने एक मान-व्हिटनी परीक्षण …

1
बायेसियन और फिशर के रैखिक भेदभावपूर्ण विश्लेषण के दृष्टिकोण
मुझे पता है कि एलडीए, बायेसियन दृष्टिकोण और फिशर के दृष्टिकोण के लिए 2 दृष्टिकोण हैं । मान लीजिए कि हमारे डेटा है (x,y)(x,y)(x,y) है, जहां है आयामी भविष्यवक्ता और के आश्रित चर है कक्षाएं।p y KxxxpppyyyKKK द्वारा बायेसियन दृष्टिकोण , हम पीछे की गणना , और के रूप में …

2
पदानुक्रमित बायेसियन मॉडल की ताकत का वर्णन करने के लिए एक अच्छा सादृश्य क्या है?
मैं बायेसियन आंकड़ों के लिए अपेक्षाकृत नया हूं और हाल ही में विभिन्न डेटासेट पर पदानुक्रमित बायेसियन मॉडल बनाने के लिए जेएजीएस का उपयोग कर रहा हूं। हालांकि मैं परिणामों से बहुत संतुष्ट हूं (मानक glm मॉडल की तुलना में), मुझे गैर-सांख्यिकीविदों को यह समझाने की आवश्यकता है कि मानक …

1
स्थानिक डेटा के लिए फिटिंग वितरण
पोस्टिंग पार mathoverflow से मेरे सवाल का कुछ आँकड़े विशेष मदद खोजने के लिए। मैं एक भौतिक प्रक्रिया उत्पन्न करने वाले डेटा का अध्ययन कर रहा हूं जो गैर-नकारात्मक मूल्यों के साथ दो आयामों में अच्छी तरह से प्रोजेक्ट करता है। प्रत्येक प्रक्रिया में - y बिंदुओं का एक (अनुमानित) …

1
क्यों है ( सेंसर किया जाता है)
एक समस्या सेट में मैंने इसे "लम्मा" साबित कर दिया, जिसका परिणाम मेरे लिए सहज नहीं है। एक सेंसर मॉडल में एक मानक सामान्य वितरण है।ZZZ औपचारिक रूप से, , और । फिर, तो एक काटे गए डोमेन पर अपेक्षा फॉर्मूला और ट्रंकेशन के बिंदु पर घनत्व के बीच किसी …

3
'सिद्ध सांख्यिकीय' की अवधारणा
जब समाचारों के बारे में बात 'सांख्यिकीय रूप से सिद्ध' हो जाती है, तो क्या वे आँकड़ों की अच्छी तरह से परिभाषित अवधारणा का सही उपयोग कर रहे हैं, इसका गलत उपयोग कर रहे हैं, या सिर्फ एक ऑक्सीमोरोन का उपयोग कर रहे हैं? मैं कल्पना करता हूं कि एक …
10 inference  proof 

1
कुल ss और ss के बीच k- साधन क्लस्टरिंग में क्या मतलब है?
मैं क्लस्टर विश्लेषण के लिए बहुत नया हूं। मैं आर का उपयोग कर रहा हूँ k- साधन क्लस्टरिंग के लिए और मुझे आश्चर्य है कि वे चीजें क्या हैं। और अगर उनका अनुपात छोटा या बड़ा है तो क्या बेहतर है?
10 clustering 

2
एक नमूने के टी-टेस्ट में, क्या होगा यदि विचरण अनुमानक में नमूना माध्य को द्वारा बदल दिया ?
एक-नमूना टी-परीक्षण मान लें, जहां अशक्त परिकल्पना । आँकड़ा तब नमूना मानक विचलन s का उपयोग कर रहा है । एस का आकलन करने में , एक अवलोकन की तुलना नमूना माध्य \ _ {x} के नमूने से करता है : t = ¯ x - μ 0μ=μ0μ=μ0\mu=\mu_0 रोंरों¯एक्सt=x¯¯¯−μ0s/n√t=x¯−μ0s/nt=\frac{\overline{x}-\mu_0}{s/\sqrt{n}}ssssssx¯¯¯x¯\overline{x} s …

1
इन दो प्रतिगमन मॉडल के बीच मूलभूत अंतर क्या है?
मान लीजिए कि मेरे पास महत्वपूर्ण सहसंबंध के साथ एक द्विघात प्रतिक्रियाएं हैं। मैं इन परिणामों को मॉडल करने के लिए दो तरीकों की तुलना करने की कोशिश कर रहा हूं। एक तरह से दो परिणामों के बीच अंतर मॉडल करने के लिए है: एक और तरीका है उपयोग करने …

1
सीपीएच की तुलना, अस्तित्व विश्लेषण के लिए त्वरित विफलता समय मॉडल या तंत्रिका नेटवर्क
मैं उत्तरजीविता विश्लेषण के लिए नया हूं और मैंने हाल ही में सीखा है कि एक निश्चित लक्ष्य को पूरा करने के लिए अलग-अलग तरीके हैं। मुझे इन विधियों के वास्तविक कार्यान्वयन और उपयुक्तता में दिलचस्पी है। मुझे पारंपरिक कॉक्स आनुपातिक-खतरों के साथ प्रस्तुत किया गया था , त्वरित विफलता …

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.