सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

3
क्या PCA के घटक वास्तव में विचरण के प्रतिशत का प्रतिनिधित्व करते हैं? क्या वे 100% से अधिक का योग कर सकते हैं?
ओ 'रेली की "मशीन लर्निंग फॉर हैकर्स" का कहना है कि प्रत्येक प्रमुख घटक विचरण के प्रतिशत का प्रतिनिधित्व करता है। मैंने नीचे पृष्ठ का प्रासंगिक भाग उद्धृत किया है (अध्याय 8, पृष्ठ 207)। एक अन्य विशेषज्ञ से बात करते हुए, उन्होंने माना कि यह प्रतिशत है। हालांकि 24 घटक …
13 r  pca 

5
प्रतिगमन में आश्रित चर के रूप में प्रतिशत का अनुमान लगाना
मेरे अध्ययन में आश्रित चर के रूप में 38 परीक्षाओं में छात्रों का रैंक प्रतिशत है। एक रैंक प्रतिशत की गणना (एक परीक्षा में छात्रों की रैंक / छात्रों की संख्या) द्वारा की जाती है। इस आश्रित चर में लगभग समान वितरण है और मैं आश्रित चर पर कुछ चर …

2
मैं एकाधिक प्रतिगमन विश्लेषण में रैखिकता धारणा का परीक्षण करने के लिए के मूल्य का उपयोग कैसे कर सकता हूं ?
नीचे दिए गए रेखांकन एक प्रतिगमन परीक्षण के अवशिष्ट तितर बितर भूखंड हैं, जिसके लिए "सामान्यता", "समरूपता" और "स्वतंत्रता" मान्यताओं को पहले से ही सुनिश्चित किया गया है! "रैखिकता" धारणा का परीक्षण करने के लिए , हालांकि, ग्राफ़ को देखकर यह अनुमान लगाया जा सकता है कि संबंध वक्रतापूर्ण है, …

6
कलाकारों की टुकड़ी को लागू करने के तरीके सीखने के लिए संसाधन
मैं सैद्धांतिक रूप से समझता हूं (जैसे वे कैसे काम करेंगे, लेकिन मुझे यकीन नहीं है कि वास्तव में एक पहनावा पद्धति (जैसे मतदान, भारित मिश्रण, आदि) का उपयोग करने के बारे में कैसे जाना जाए। पहनावा तरीकों को लागू करने के लिए अच्छे संसाधन क्या हैं? क्या पायथन में …

4
DoE के बारे में फिशर के उद्धरण का वास्तविक चित्रण करना
मेरी टीम और मैं प्रयोगों के डिजाइन की उपयोगिता के बारे में कंपनी के गैर-सांख्यिकीविदों को एक प्रस्तुति देना चाहते हैं। ये गैर-सांख्यिकीविद भी हमारे ग्राहक हैं और वे आमतौर पर अपना डेटा एकत्र करने से पहले हमसे सलाह नहीं लेते हैं। क्या आप कुछ वास्तविक उदाहरणों को जानते हैं …

2
बड़े नमूना आकार के लिए अव्यवस्था की समस्या क्यों होती है?
मान लीजिए कि हमारे पास के अंक का एक सेट है । वितरण बिंदु का उपयोग करके प्रत्येक बिंदु उत्पन्न होता है लिए पोस्टीरियर प्राप्त करने के लिए हम पर Minka पेपर के अनुसार उम्मीद प्रचार हम की जरूरत है गणना पीछे प्राप्त करने के लिए और, इसलिए, समस्या बड़ी …

1
बायेसियन glm में -values ​​को समझने में मेरी मदद करें
मैं यहां डेटा पर बायेसियन लॉग चलाने की कोशिश कर रहा हूं । मैं उपयोग कर रहा हूँ bayesglm()में armआर कोडिंग में पैकेज सीधा पर्याप्त है: df = read.csv("http://dl.dropbox.com/u/1791181/bayesglm.csv", header=T) library(arm) model = bayesglm(PASS ~ SEX + HIGH, family=binomial(link="logit"), data=df) summary(model) निम्नलिखित आउटपुट देता है: Coefficients: Estimate Std. Error z …
13 r  bayesian  p-value 

2
समूहीकृत जोड़े को दर्शाने वाली तालिका में एक Tukey HSD पोस्ट-हॉक टेस्ट के परिणाम कैसे प्राप्त करें?
मैं आर के साथ अपने दो-तरफ़ा अनोवा के बाद एक तुकेशएचएसडी पोस्ट-हॉक टेस्ट करना पसंद करूंगा, एक तालिका प्राप्त करना जिसमें महत्वपूर्ण अंतर द्वारा समूहीकृत जोड़े शामिल हैं। (शब्दों के बारे में क्षमा करें, मैं अभी भी आँकड़ों के साथ नया हूँ।) मैं इस तरह से कुछ करना चाहूंगा: तो, …

1
आर में glmnet का उपयोग कर भविष्यवाणियों
मैं glmnetआर में पैकेज का उपयोग करके कुछ डेटा मॉडल करने की कोशिश कर रहा हूं । मान लीजिए कि मेरे पास निम्न डेटा है training_x <- data.frame(variable1 = c(1, 2, 3, 2, 3), variable2 = c(1, 2, 3, 4, 5)) y <- c(1, 2, 3, 4, 5) (यह एक …
13 r  glmnet 

4
डेटासेट के यादृच्छिक उपसमूह के माध्यम से K- साधन केंद्रों की शुरुआत?
अगर मेरे पास एक निश्चित डेटासेट है, तो उस डेटासेट के यादृच्छिक नमूनों के माध्यम से क्लस्टर केंद्रों को शुरू करना कितना स्मार्ट होगा? उदाहरण के लिए, मान लीजिए कि मुझे चाहिए 5 clusters। मैं मूल डेटासेट के बारे 5 random samplesमें कहता हूं size=20%। फिर मैं इन 5 यादृच्छिक …


1
मजेदार आँकड़े परीक्षा के उत्तर [बंद]
बन्द है। यह सवाल ऑफ टॉपिक है । यह वर्तमान में उत्तर स्वीकार नहीं कर रहा है। इस प्रश्न को सुधारना चाहते हैं? प्रश्न को अपडेट करें ताकि यह क्रॉस मान्य के लिए विषय पर हो । 7 साल पहले बंद हुआ । परीक्षा को सही करना शायद एक शिक्षक …
13 teaching  humor 

1
लॉजिस्टिक रिग्रेशन पैरामीटर की गणना के लिए क्षणों (जीएमएम) की सामान्यीकृत विधि का उपयोग करना
मैं एक रिग्रेशन के गुणांक की गणना करना चाहता हूं जो लॉजिस्टिक रिग्रेशन (वास्तव में एक और गुणांक के साथ लॉजिस्टिक रिग्रेशन के समान है: जब दिया जा सकता है)। मैंने गुणांक की गणना करने के लिए GMM का उपयोग करने के बारे में सोचा था, लेकिन मुझे यकीन नहीं …

1
बड़ी संख्या का कानून कब विफल होता है?
सवाल बस यह है कि शीर्षक में क्या कहा गया है: बड़ी संख्या का कानून कब विफल होता है? मेरे कहने का मतलब यह है कि किन मामलों में किसी घटना की आवृत्ति सैद्धांतिक संभावना तक नहीं होगी?

3
मशीन लर्निंग में नवीनतम घटनाओं पर नज़र रखने के लिए अच्छी, स्वतंत्र रूप से उपलब्ध पत्रिकाएँ क्या हैं?
ज्ञान के किसी अन्य उपयोगी पोर्टल के लिए 'पत्रिकाओं' के विकल्प के लिए स्वतंत्र महसूस करें। मैं व्यावहारिक अनुप्रयोगों के लिए मशीन लर्निंग में नए विकास पर नज़र रखने में दिलचस्पी रखता हूं। मैं अपना खुद का काम प्रकाशित करने के लिए अकादमिक नहीं हूं (कम से कम इस क्षेत्र …

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.