सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

1
डेंड्रोग्राम क्लस्टरिंग के लिए सहसंबंधी सहसंबंध
डेंड्रोग्राम क्लस्टरिंग के संदर्भ पर विचार करें। आइए हम मूल भिन्नताओं को व्यक्तियों के बीच की दूरी कहते हैं । डेंड्रोग्राम के निर्माण के बाद, हम दो व्यक्तियों के बीच केपहेटिक असमानता को उन समूहों के बीच की दूरी के रूप में परिभाषित करते हैं, जिनसे ये व्यक्ति जुड़े हैं। …

2
द्विआधारी और निरंतर प्रतिक्रिया को संयोजित करने का सबसे अच्छा तरीका
मैं एक संग्रह एजेंसी के लिए भुगतान राशि की भविष्यवाणी करने के लिए सबसे अच्छे तरीके से आने की कोशिश कर रहा हूं। भुगतान किए जाने पर आश्रित चर केवल गैर-शून्य होता है। जाहिर है, वहाँ शून्य की एक भारी संख्या है क्योंकि अधिकांश लोगों तक नहीं पहुंचा जा सकता …

3
समय के साथ पूर्वाग्रह अलग करने के लिए एक पक्षपाती सिक्का कैसे मॉडल करें?
पक्षपाती सिक्कों के मॉडल में आमतौर पर एक पैरामीटर होता है । एक तरीका यह अनुमान लगाने के लिए एक श्रृंखला के ड्रॉ से द्विपद संभावना के साथ एक बीटा पूर्व और गणना पिछला वितरण उपयोग करने के लिए है।θθ = पी( प्रमुख | θ )θ=P(Head|θ)\theta = P(\text{Head} | \theta)θθ\theta …


2
आर में विल्कोक्सन-मान-व्हिटनी महत्वपूर्ण मूल्य
मैंने देखा है कि जब मैं R का उपयोग करके मैन-व्हिटनी यू के लिए महत्वपूर्ण मूल्यों को खोजने की कोशिश करता हूं, तो मान हमेशा 1 + महत्वपूर्ण मूल्य होते हैं। उदाहरण के लिए, α = .05 , n = 10 , m = 5α=.05,n=10,m=5\alpha=.05, n = 10, m = …

4
R बनाम SciPy में लॉग-सामान्य वितरण फिटिंग
मैंने डेटा के सेट के साथ R का उपयोग करके एक लॉगऑनॉर्मल मॉडल फिट किया है। परिणामी पैरामीटर निम्न थे: meanlog = 4.2991610 sdlog = 0.5511349 मैं इस मॉडल को स्पीपी में स्थानांतरित करना चाहता हूं, जिसका मैंने पहले कभी उपयोग नहीं किया है। Scipy का उपयोग करते हुए, मैं …
10 r  python  numpy  scipy 

2
इन कस्टम विरोधाभासों की व्याख्या कैसे करें?
मैं कस्टम विरोधाभासों के साथ एक तरह से एनोवा (प्रति प्रजाति) कर रहा हूं। [,1] [,2] [,3] [,4] 0.5 -1 0 0 0 5 1 -1 0 0 12.5 0 1 -1 0 25 0 0 1 -1 50 0 0 0 1 जहाँ मैं 5 की तीव्रता 0.5 की …

2
"समान" स्रोत कोड के क्लस्टर का पता लगाना
मान लें कि मेरे पास 400 छात्र हैं (जो एक बड़े विश्वविद्यालय में हैं) जिन्हें कंप्यूटर विज्ञान परियोजना करनी है, और उन्हें अकेले काम करना होगा (छात्रों का कोई समूह नहीं)। प्रोजेक्ट का एक उदाहरण "फोरट्रान में एक तेज फूरियर ट्रांसफॉर्म एल्गोरिथ्म को लागू करने" को दिया जा सकता है …

3
कम से कम मेमोरी का उपयोग करके प्रशिक्षण डेटा का सबसे कुशल तरीका क्या है?
यह मेरा प्रशिक्षण डेटा है: 200,000 उदाहरण x 10,000 सुविधाएँ। तो मेरा प्रशिक्षण डेटा मैट्रिक्स है - 200,000 x 10,000। मैंने प्रत्येक फ़िमेल को एक-एक करके (एक के बाद एक उदाहरण) सहेज कर मेमोरी मुद्दों के बिना एक सपाट फ़ाइल में इसे सहेजने में कामयाबी हासिल की, क्योंकि मैं प्रत्येक …

1
शून्य फुले हुए पॉइसन मॉडल के एक अव्यक्त चर सूत्रीकरण के लिए MLE की गणना करने के लिए आप EM एल्गोरिथ्म का उपयोग कैसे करते हैं?
शून्य फुलाया प्वासों प्रतिगमन मॉडल एक नमूने के लिए परिभाषित किया गया है द्वारा Y मैं = { 0 संभावना के साथ पी मैं + ( 1 - पी मैं ) ई - λ मैं कश्मीर के साथ संभाव्यता ( 1 - पी मैं ) e - λ i λ …

1
क्या देखा गया एलील आवृत्ति पूर्वानुमानित की तुलना में काफी कम है?
प्रश्न : मैं यह निर्धारित करने के लिए एक परीक्षण का निर्माण कैसे कर सकता हूं कि क्या देखा गया कि "माउंटेन" -लेरल फ़्रीक्वेंसी (छवि 1) पारिस्थितिक चयन मॉडल ( विवरण के लिए नीचे देखें ) द्वारा अनुमानित (छवि 2) की तुलना में मध्य से दक्षिणी पहाड़ों में काफी कम …

2
मल्टीकल के लिए लॉजिस्टिक रिग्रेशन
मुझे मल्टीस्कल्स के लिए लॉजिस्टिक रिग्रेशन के लिए मॉडल मिला है, जो इसके द्वारा दिया गया है P(Y=j|X(i))=exp(θTjX(i))1+∑km=1exp(θTmX(i))P(Y=j|X(i))=exp⁡(θjTX(i))1+∑m=1kexp⁡(θmTX(i)) P(Y=j|X^{(i)}) = \frac{\exp(\theta_j^TX^{(i)})}{1+ \sum_{m=1}^{k}\exp(\theta_m^T X^{(i)})} जहां k कक्षाओं की संख्या है, थीटा पैरामीटर है, अनुमान लगाया जा सकता है कि jth वर्ग ग्यारहवीं प्रशिक्षण डेटा है अच्छी तरह से एक चीज जो …

1
अतुल्यकालिक (अनियमित) समय श्रृंखला विश्लेषण
मैं दो स्टॉक कीमतों की समय श्रृंखला के बीच लीड-लैग का विश्लेषण करने की कोशिश कर रहा हूं। नियमित समय श्रृंखला विश्लेषण में, हम क्रॉस कोरेलाटन, वीईसीएम (ग्रेंजर कॉजेलिटी) कर सकते हैं। हालाँकि अनियमित समय की श्रृंखला में कोई भी इसे कैसे संभालता है। परिकल्पना यह है कि उपकरणों में …

1
मुझे पाली (कच्चे = टी) बनाम पाली () के लिए बेतहाशा अलग-अलग परिणाम क्यों मिलते हैं?
मैं दो अलग-अलग समय चर को मॉडल करना चाहता हूं, जिनमें से कुछ मेरे डेटा (आयु + कोहर्ट = अवधि) में भारी रूप से मेल खाते हैं। ऐसा करने से मैं कुछ परेशानियों में घिर गया lmerऔर बातचीत करने लगा poly(), लेकिन यह शायद सीमित नहीं है lmer, मुझे nlmeIIRC …

3
बहुराष्ट्रीय उपस्कर प्रतिगमन धारणाएं
बहुराष्ट्रीय लॉजिस्टिक प्रतिगमन की उचित धारणाएं क्या हैं? और SPSS 18 का उपयोग करके इन मान्यताओं को संतुष्ट करने के लिए सबसे अच्छे परीक्षण क्या हैं?

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.