सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

2
Nakagawa & Schielzeth (2013) R2glmm विधि का उपयोग करके मिश्रित मॉडल में गणना
मैं मिश्रित मॉडलों में मानों की गणना के बारे में पढ़ रहा हूं और R-sig FAQ पढ़ने के बाद, इस मंच पर अन्य पोस्ट (मैं कुछ लिंक करूंगा लेकिन मेरे पास पर्याप्त प्रतिष्ठा नहीं है) और कई अन्य संदर्भ मुझे समझ में आए मिश्रित मॉडल के संदर्भ में मान जटिल …

2
दैनिक डेटा के लिए कई प्रतिगमन में मौसमी कैप्चरिंग
मेरे पास एक उत्पाद के लिए दैनिक बिक्री डेटा है जो अत्यधिक मौसमी है। मैं रिग्रेशन मॉडल में मौसमी को पकड़ना चाहता हूं। मैंने पढ़ा है कि अगर आपके पास त्रैमासिक या मासिक डेटा है, तो उस स्थिति में आप क्रमशः 3 और 11 डमी चर बना सकते हैं - …

2
हम निर्णय पेड़ों के लिए आरओसी वक्र कैसे बना सकते हैं?
आम तौर पर हम निर्णय पेड़ों की तरह असतत classifiers के लिए एक आरओसी वक्र आकर्षित नहीं कर सकते। क्या मैं सही हू? वहाँ किसी भी तरह से dsr के लिए एक आरओसी वक्र आकर्षित करने के लिए है?
13 roc  cart 

1
एक अनुभवजन्य सीडीएफ का घालमेल
मेरा अनुभवजन्य वितरण । मैं इसकी गणना इस प्रकार करता हूंG(x)G(x)G(x) x <- seq(0, 1000, 0.1) g <- ecdf(var1) G <- g(x) मैं , यानी को पीडीएफ निरूपित करता हूं जबकि सीएफडी है।h Gh(x)=dG/dxh(x)=dG/dxh(x) = dG/dxhhhGGG मैं अब एकीकरण की ऊपरी सीमा के लिए एक समीकरण को हल (जैसे कि, …
13 r  integral  ecdf 

1
ची-चुकता परीक्षण और ची-चुकता वितरण को समझना
मैं ची-स्क्वेर्ड टेस्ट के पीछे के तर्क को समझने की कोशिश कर रहा हूं। Chi-squared परीक्षण । के बाद n- परिकल्पना को अस्वीकार करने या न करने के लिए एक p.value का पता लगाने के लिए एक ची-चुकता वितरण की तुलना में है। : हम अपने अपेक्षित मूल्यों को बनाने …

2
क्या असतत डेटा के लिए लाइन भूखंडों का उपयोग करना गलत है?
मैंने अक्सर असतत डेटासेट्स को लाइन प्लॉट्स के रूप में देखा है, लेकिन मेरे साथ ऐसा होता है कि लाइन माप अंतरालों के बीच एक बिंदु पर एक मान को प्रभावित करती है जो असतत डेटासेट के लिए अर्थहीन है। इसलिए यह मामला असतत डेटा के लिए लाइन प्लॉट का …

2
टिप्पणियों के भंडारण के बिना चतुर्थक का ऑनलाइन अनुमान
मुझे टिप्पणियों के भंडारण के बिना डेटा के एक बड़े सेट पर वास्तविक समय में क्वार्टर्टाइल (Q1, मध्य और Q3) की गणना करने की आवश्यकता है। मैंने पहली बार P वर्ग एल्गोरिथ्म (जैन / क्लैमटैक) की कोशिश की, लेकिन मैं इससे संतुष्ट नहीं था (थोड़ा बहुत सीपीयू उपयोग और कम …

4
एक प्रतिगमन मॉडल जिसका प्रतिसाद चर वर्ष का वह दिन है जो एक वार्षिक घटना (आमतौर पर) होती है
इस विशेष मामले में मैं उस दिन की बात कर रहा हूं जिस दिन एक झील जम जाती है। यह "आइस-ऑन" तिथि केवल वर्ष में एक बार होती है, लेकिन कभी-कभी यह बिल्कुल भी नहीं होती है (यदि सर्दी गर्म है)। तो एक वर्ष में झील 20 दिन (20 वीं …

2
आप n tosses से k शीर्षासन करते हैं। क्या सिक्का उचित है?
मुझे एक साक्षात्कार में के साथ यह प्रश्न पूछा गया था । क्या कोई "सही" उत्तर है?( n , k ) = ( 400 , 220 )(n,k)=(400,220)(n, k) = (400, 220) मान लें कि टॉस iid हैं और हेड्स की संभावना । 400 टोस में सिर की संख्या का वितरण …

4
जब आप किमी कोहनी क्लस्टरिंग के लिए कोई कोहनी बिंदु नहीं है तो आप क्या करते हैं
मैंने सीखा है कि जब कई समूहों को चुनते हैं, तो आपको कश्मीर के विभिन्न मूल्यों के लिए एक कोहनी बिंदु की तलाश करनी चाहिए। मैंने कश्मीर के मूल्यों को 1 से 10 तक के मूल्यों के लिए प्लॉट किया है, लेकिन मैं स्पष्ट नहीं देख रहा हूं कोहनी। इस …

2
KMEANS में k की संख्या का अनुमान लगाने के लिए BIC का उपयोग करना
मैं वर्तमान में अपने खिलौना डेटा सेट (inc iris (:) के लिए BIC की गणना करने की कोशिश कर रहा हूं। मैं यहां दिखाए गए अनुसार परिणाम को पुन: उत्पन्न करना चाहता हूं (चित्र 5)। यह पेपर भी BIC फॉर्मूलों के लिए मेरा स्रोत है। मुझे इसके साथ 2 समस्याएं …

1
फर्थ लॉजिस्टिक रिग्रेशन की एक सैद्धांतिक समझ की तलाश
मैं फर्थ लॉजिस्टिक रिग्रेशन (लॉजिस्टिक रिग्रेशन में परफेक्ट / कम्प्लीट या क्वासी-कम्प्लीट सेपरेशन को हैंडल करने का तरीका) को समझने की कोशिश कर रहा हूं ताकि मैं इसे दूसरों को सरल शब्दों में समझा सकूं। क्या किसी के पास डमी-डाउन स्पष्टीकरण है कि संशोधन का अनुमान MLE को क्या बना …

1
निरंतर चर और श्रेणीगत चर के बीच सहसंबंध का अनुमान लगाने के लिए आपसी जानकारी का उपयोग करना
शीर्षक के रूप में, विचार एक निरंतर चर और एक श्रेणीगत चर के बीच "सहसंबंध" (परिभाषित के रूप में "मुझे पता है कि जब मैं बी के बारे में कितना जानता हूं") के रूप में अनुमान लगाने के लिए, यहां और एमआई के बाद आपसी जानकारी का उपयोग करना है। …

3
बायेसियन बनाम MLE, ओवरफिटिंग समस्या
बिशप की पीआरएमएल पुस्तक में, वह कहते हैं कि, ओवरफिटिंग अधिकतम संभावना अनुमान (एमएलई) के साथ एक समस्या है, और बेयसियन इससे बच सकते हैं। लेकिन मुझे लगता है, ओवरफिटिंग मॉडल चयन के बारे में अधिक समस्या है, पैरामीटर अनुमान करने के लिए इस्तेमाल की जाने वाली विधि के बारे …

1
LLE (स्थानीय रैखिक एम्बेडिंग) एल्गोरिथ्म के चरण बताएं?
मैं समझता हूं कि एलएलई के लिए एल्गोरिथ्म के पीछे मूल सिद्धांत तीन चरणों के होते हैं। कुछ मीट्रिक जैसे k-nn द्वारा प्रत्येक डेटा बिंदु के पड़ोस का पता लगाना। प्रत्येक पड़ोसी के लिए वेट खोजें, जो डेटा बिंदु पर पड़ोसी के प्रभाव को दर्शाता है। गणना की गई वज़न …

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.