सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

4
दो से अधिक नमूनों के बीच मध्यस्थों में अंतर के लिए परिकल्पना परीक्षण
सवाल आर में अलग-अलग वैक्टर के रूप में लोगों के तीन समूहों के परीक्षण स्कोर को बचाया जाता है। set.seed(1) group1 <- rnorm(100, mean = 75, sd = 10) group2 <- rnorm(100, mean = 85, sd = 10) group3 <- rnorm(100, mean = 95, sd = 10) मैं जानना चाहता …

3
सहज कारण क्यों द्विपद की फिशर सूचना विपरीत आनुपातिक है
यह मेरे मन को भ्रमित करता है / करता है कि द्विपद का विचलन । समान रूप से, फिशर जानकारी समानुपाती होती है । इसका कारण क्या है? फिशर सूचना को पर कम क्यों किया जाता है ? यही कारण है, पर सबसे अधिक मुश्किल क्यों है ?1पी ( 1 …

2
टी-वितरण घनत्व समारोह के पीछे अंतर्ज्ञान
मैं स्टूडेंट के टी-डिस्ट्रीब्यूशन के बारे में पढ़ रहा हूं और मुझे आश्चर्य होने लगा है कि टी-डिस्ट्रीब्यूशन डेंसिटी फंक्शन (विकिपीडिया, http://en.wikipedia.org/wiki/Student%27s_t-distribution से ) कोई कैसे निकालेगा : f(t)=Γ(v+12)vπ−−√Γ(v2)(1+t2v)−v+12f(t)=Γ(v+12)vπΓ(v2)(1+t2v)−v+12f(t) = \frac{\Gamma(\frac{v+1}{2})}{\sqrt{v\pi}\:\Gamma(\frac{v}{2})}\left(1+\frac{t^2}{v} \right)^{-\frac{v+1}{2}} जहां स्वतंत्रता की डिग्री है और गामा फ़ंक्शन है। इस फ़ंक्शन का अंतर्ज्ञान क्या है? मेरा मतलब है, …

2
क्या MLE का हमेशा मतलब है कि हम अपने डेटा के अंतर्निहित पीडीएफ को जानते हैं, और क्या EM का अर्थ है कि हम नहीं?
मेरे कुछ सरल वैचारिक प्रश्न हैं, जिन्हें मैं MLE (अधिकतम संभावना अनुमान) के बारे में स्पष्ट करना चाहूंगा, और ईएम (एक्सपेक्टेशन मैक्सिमाइजेशन) से इसका क्या लिंक है, यदि कोई है। जैसा कि मैं इसे समझता हूं, अगर कोई कहता है कि "हमने MLE का उपयोग किया है", क्या इसका मतलब …

10
सामान्य शब्द जिनके विशेष सांख्यिकीय अर्थ होते हैं
मैं एक सांख्यिकीविद् नहीं हूं, लेकिन मेरे शोध कार्य में आंकड़े शामिल हैं (डेटा का विश्लेषण, साहित्य पढ़ना, आदि)। मुझे फिर से यहां पोस्ट किए गए मेरे एक प्रश्न पर एक टिप्पणी से याद दिलाया गया था कि कुछ सामान्य शब्द हैं जो विशेष रूप से उन लोगों के लिए …

2
मैं बहु-प्रतीक्षित डेटा सेटों में पी-मान को बूटस्ट्रैप कैसे कर सकता हूं?
मैं इस समस्या से चिंतित हूं कि मैं बहु -अनुमानित डेटा (MI) डेटा से एक अनुमान के लिए p-value को बूटस्ट्रैप करना चाहूंगा , लेकिन यह मेरे लिए स्पष्ट नहीं है कि एमआई सेट में पी-वैल्यू को कैसे संयोजित किया जाए।θθ\theta एमआई डेटा सेट के लिए, अनुमानों के कुल विचरण …

2
क्यों कुछ लोग अपने कच्चे डेटा पर प्रतिगमन जैसी मॉडल मान्यताओं का परीक्षण करते हैं और अन्य लोग अवशिष्ट पर उनका परीक्षण करते हैं?
मैं प्रयोगात्मक मनोविज्ञान में एक पीएचडी छात्र हूं और मैं अपने कौशल और ज्ञान को बेहतर बनाने के लिए कड़ी मेहनत करता हूं कि मुझे अपने डेटा का विश्लेषण कैसे करना है। मनोविज्ञान में मेरे 5 वें वर्ष तक, मैंने सोचा कि प्रतिगमन-जैसे मॉडल (जैसे, एनोवा) निम्नलिखित बातों को मानते …

5
शब्द आवृत्ति / उलटा दस्तावेज़ आवृत्ति (TF / IDF): भार
मुझे एक डेटासेट मिला है जो 1000 दस्तावेजों और उसमें दिखाई देने वाले सभी शब्दों का प्रतिनिधित्व करता है। इसलिए पंक्तियाँ दस्तावेजों का प्रतिनिधित्व करती हैं और कॉलम शब्दों का प्रतिनिधित्व करते हैं। उदाहरण के लिए, सेल में मान बार शब्द के लिए खड़ा है दस्तावेज़ में होता है । …

1
"इन-सैंपल" और "छद्म आउट-ऑफ-सैंपल" पूर्वानुमानों के बीच अंतर
क्या नमूना पूर्वानुमान और छद्म आउट-ऑफ-नमूना पूर्वानुमान के बीच एक स्पष्ट अंतर है । दोनों पूर्वानुमान मॉडल के मूल्यांकन और तुलना के संदर्भ में है।

5
जॉन केरिच सिक्का-फ्लिप डेटा
क्या कोई सुझाव दे सकता है कि डब्लूईआईआई द्वारा जॉन केरिच द्वारा किए गए 10,000 सिक्का फ़्लिप (यानी, सभी 10,000 सिर और पूंछ) के परिणाम प्राप्त करने के लिए कहां है?

4
मान जो मानक विचलन को बढ़ाता है
मैं निम्नलिखित कथन से हैरान हूँ: "संख्याओं के एक समूह के मानक विचलन को बढ़ाने के लिए, आपको एक मान जोड़ना होगा जो औसत से दूर एक मानक विचलन से अधिक है" इसका क्या प्रमाण है? मुझे पता है कि हम मानक विचलन को कैसे परिभाषित करते हैं, लेकिन वह …

2
एकत्रीकरण के तहत कौन से आंकड़े संरक्षित हैं?
अगर हमारे पास एक लंबी, उच्च रिज़ॉल्यूशन टाइम सीरीज़ है, तो बहुत सारे शोर के साथ, यह अक्सर डेटा को कम रिज़ॉल्यूशन (कहने के लिए, दैनिक मासिक मूल्यों पर) को बेहतर बनाने के लिए समझ में आता है कि क्या चल रहा है, प्रभावी रूप से कुछ को हटाने के …

4
बहुत बड़े नमूना आकारों के लिए अच्छाई-से-फिट
मैं प्रत्येक दिन श्रेणीबद्ध डेटा के बहुत बड़े नमूने (> 1,000,000) एकत्र करता हूं और डेटा संग्रह में त्रुटियों का पता लगाने के लिए डेटा को "महत्वपूर्ण" दिनों के बीच अलग-अलग देखना चाहता हूं। मैंने सोचा कि एक अच्छा-फिट परीक्षण (विशेष रूप से, एक जी-टेस्ट) का उपयोग करना इसके लिए …

1
क्या मल्टीकोलिनरिटी और स्प्लिन रिग्रेशन के लिए कोई समस्या है?
प्राकृतिक (यानी प्रतिबंधित) क्यूबिक स्प्लिन का उपयोग करते समय, बनाए गए आधार फ़ंक्शन अत्यधिक मिलीभगत होते हैं, और जब एक प्रतिगमन में उपयोग किया जाता है तो बहुत अधिक वीआईएफ (विचरण मुद्रास्फीति कारक) आंकड़े का उत्पादन होता है, जो मल्टीकोलिनरिटी का संकेत देता है। जब कोई भविष्यवाणी उद्देश्यों के लिए …

1
क्या "अभिन्न के औसत" से बेहतर नाम है?
मैं थ्रॉटल पोजीशन सेंसर (टीपीएस) का परीक्षण कर रहा हूं, मेरा व्यवसाय बेचता है और मैं थ्रॉटल शाफ्ट के रोटेशन के लिए वोल्टेज प्रतिक्रिया की साजिश को प्रिंट करता हूं। TPS 90 ° रेंज वाला एक घूर्णी सेंसर होता है और आउटपुट एक पोटेंशियोमीटर की तरह होता है जिसमें पूर्ण …

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.