सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

1
एंगल-ग्रेंजर दो-चरण विधि का उपयोग करके दो समय श्रृंखला के बीच संयोग के लिए टेस्ट
मैं दो समय श्रृंखला के बीच संयोग के लिए परीक्षण करना चाहता हूं। दोनों श्रृंखलाओं में साप्ताहिक डेटा है जो 3 साल का है। मैं एंगल-ग्रेंजर टू स्टेप मेथड करने की कोशिश कर रहा हूं। संचालन का मेरा क्रम निम्नानुसार है। ऑगमेंटेड डिकी-फुलर के माध्यम से यूनिट रूट के लिए …

3
सामान्य रूप से वितरित डेटा के लिए स्टूडेंट के टी-टेस्ट की तुलना में विलकॉक्सन टेस्ट की एसिम्प्टोटिक सापेक्ष दक्षता क्यों है ?
यह सर्वविदित है कि विलकॉक्सन हस्ताक्षरित रैंक परीक्षण की एसिम्प्टोटिक सापेक्ष दक्षता (हैं) स्टूडेंट के t की तुलना में है , यदि डेटा सामान्य रूप से वितरित जनसंख्या से खींचा जाता है। यह बुनियादी एक-नमूना परीक्षण और दो स्वतंत्र नमूनों (विल्कोक्सन-मान-व्हिटनी यू) के लिए संस्करण के लिए सच है। सामान्य …

4
एक कारोबारी माहौल में सांख्यिकीय विश्लेषण के लिए अच्छा अभ्यास
(हालांकि मुझे एहसास है कि यह आंकड़ों के बारे में कड़ाई से नहीं है, यह एक कारोबारी माहौल में आंकड़ों के प्रसार के बारे में है, इसलिए मैंने यह मान लिया है कि यह अभी भी सीवी के विषय सीमा के भीतर है) एक संक्षिप्त पृष्ठभूमि: हमारे व्यावसायिक वातावरण (और …

2
मान-व्हिटनी यू-टेस्ट: प्रभाव के आकार के लिए आत्मविश्वास अंतराल
फ्रिट्ज़, मॉरिस और रिचलर (2011; नीचे देखें) के अनुसार, को मान-व्हिटनी यू-टेस्ट के लिए एक सूत्र के रूप में परिकलित किया जा सकता है सूत्र का उपयोग करके। यह सुविधाजनक है मुझे, मैं रिपोर्ट के रूप में अन्य अवसरों पर भी। मैं प्रभाव आकार माप के अलावा लिए आत्मविश्वास अंतराल …

5
ग्रेडिंग छात्र पत्रों में उदारता के विभिन्न स्तरों के साथ मार्करों के प्रभावों से मैं सबसे अच्छा कैसे निपट सकता हूं?
लगभग 600 छात्रों का मूल्यांकन के एक व्यापक टुकड़े पर एक अंक है, जिसे अच्छी विश्वसनीयता / वैधता माना जा सकता है। मूल्यांकन 100 में से स्कोर किया गया है, और यह कंप्यूटर द्वारा चिह्नित एक बहु-विकल्प परीक्षण है। उन 600 छात्रों के पास एक दूसरे, मामूली, मूल्यांकन के टुकड़े …

1
आर: रैखिक मॉडल के अवशेषों की सामान्यता का परीक्षण करें - जो अवशिष्ट का उपयोग करें
मैं एक Shapiro Wilk W परीक्षण करना चाहता हूँ और Kolmogorov-Smirnov परीक्षण एक रेखीय मॉडल के अवशिष्ट पर सामान्यता की जाँच करने के लिए। मैं बस सोच रहा था कि इसके लिए कौन से अवशिष्ट का उपयोग किया जाना चाहिए - कच्चे अवशिष्ट, पियर्सन अवशिष्ट, छात्र अवशिष्ट या मानकीकृत अवशिष्ट? …

1
अवलोकन के स्वतंत्र न होने पर अमान्य निष्कर्ष
मैंने प्राथमिक आँकड़ों में सीखा कि सामान्य रेखीय मॉडल के साथ, इनफ़ॉर्म्स वैध होने के लिए, टिप्पणियों को स्वतंत्र होना चाहिए। जब क्लस्टरिंग होती है, तो स्वतंत्रता को अमान्य निष्कासन के लिए अग्रणी नहीं रखा जा सकता है जब तक कि यह हिसाब न हो। मिश्रित मॉडल का उपयोग करके …

2
एक असंगत अधिकतम संभावना अनुमानक का उदाहरण
मैं एक कागज़ पर एक टिप्पणी पढ़ रहा हूं, और लेखक कहता है कि कभी-कभी, भले ही अनुमानक (एमएल या अधिकतम क्वासिलिकेलहुड द्वारा पाया जाता है) सुसंगत नहीं हो सकते हैं, एक संभावना अनुपात या अर्ध-संभावना अनुपात परीक्षण की शक्ति अभी भी परिवर्तित हो सकती है 1 के रूप में …

2
कैरेट पैकेज का उपयोग करना विशिष्ट थ्रेशोल्ड मूल्यों के लिए भ्रम मैट्रीस प्राप्त करना संभव है?
मैंने trainद्विआधारी प्रतिक्रिया के लिए एक लॉजिस्टिक रिग्रेशन मॉडल (के माध्यम से ) प्राप्त किया है, और मैंने लॉजिस्टिक कंफ्यूजन मैट्रिक्स के माध्यम से प्राप्त किया confusionMatrixहै caret। यह मुझे लॉजिस्टिक मॉडल कन्फ्यूजन मैट्रिक्स देता है, हालांकि मुझे यकीन नहीं है कि इसे प्राप्त करने के लिए किस सीमा का …

1
हमेशा सदृश सीखने का उपयोग क्यों न करें?
यह मुझे लगता है कि सीखना सीखना हमेशा एक एकल सीखने की परिकल्पना की तुलना में बेहतर भविष्य कहनेवाला प्रदर्शन देना होगा। तो, हम हर समय उनका उपयोग क्यों नहीं करते हैं? मेरा अनुमान शायद, कम्प्यूटेशनल सीमाओं के कारण है? (फिर भी, हम कमजोर भविष्यवक्ताओं का उपयोग करते हैं, इसलिए …

1
कैसे परीक्षण करें कि क्या वितरण एक बिजली कानून का पालन करता है?
मेरे पास यह डेटा है कि कितने उपयोगकर्ता कितने प्रश्न पोस्ट करते हैं। उदाहरण के लिए, [UserCount, QuestionCount] [2, 100] [9, 10] [3, 80] ... ... इसका मतलब है कि 2 उपयोगकर्ताओं ने प्रत्येक 100 प्रश्न पोस्ट किए, 9 उपयोगकर्ताओं ने प्रत्येक 10 प्रश्न पोस्ट किए, और इसी तरह। इसलिए, …

4
क्रॉस सत्यापन डेटा स्नूपिंग से अलग कैसे है?
मैंने "सांख्यिकीय शिक्षा का एक परिचय" समाप्त किया । मैंने सोचा कि क्या विभिन्न मशीन लर्निंग तकनीकों के लिए सर्वोत्तम ट्यूनिंग मापदंडों को खोजने के लिए क्रॉस-मान्यता का उपयोग करना डेटा स्नूपिंग से अलग है? हम बार-बार जाँच रहे हैं कि ट्यूनिंग पैरामीटर के कौन से मूल्य परीक्षण सेट में …

2
क्या कभी कोई कारण है कि फिटिंग के रजिस्टरों के दौरान ऑर्थोगोनल पोलीनोमियल का उपयोग नहीं किया जाता है?
सामान्य तौर पर, मैं सोच रहा हूं कि उच्च क्रम वाले चर के साथ एक प्रतिगमन को फिट करते समय ऑर्थोगोनल पॉलीओनियम्स का उपयोग करना बेहतर नहीं है। विशेष रूप से, मैं आर के उपयोग के साथ सोच रहा हूं: तो poly()साथ raw = FALSEके रूप में ही फिट मूल्यों …

1
R की lm () मेरी पाठ्यपुस्तक की तुलना में अलग गुणांक का अनुमान क्यों लगाती है?
पृष्ठभूमि मैं फिटिंग मॉडलों पर एक कोर्स में पहला उदाहरण समझने की कोशिश कर रहा हूं (इसलिए यह बहुत सरल लग सकता है)। मैंने हाथ से गणना की है और वे उदाहरण से मेल खाते हैं, लेकिन जब मैं उन्हें आर में दोहराता हूं, तो मॉडल गुणांक बंद हो जाते …
13 r  regression  self-study  lm 

2
एक बंद अंतराल में सभी तर्कसंगत मूल्यों को लेते हुए एकसमान यादृच्छिक चर (?) को अलग करें
मुझे सिर्फ (बौद्धिक) पैनिक अटैक आया था। एक निरंतर यादृच्छिक चर जो एक बंद अंतराल में एक वर्दी का अनुसरण करता है : एक आराम से परिचित सांख्यिकीय अवधारणा। U(a,b)U(a,b)U(a,b) विस्तारित वास्तविक (आधे या पूरे) पर एक निरंतर वर्दी आरवी का समर्थन: एक आरवी उचित नहीं है, लेकिन एक अनुचित …

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.