सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

1
गैर-नकारात्मक शून्य-फुलाया निरंतर डेटा कैसे मॉडल करें?
मैं वर्तमान family = gaussianमें जैव विविधता के एक संकेतक के लिए एक रेखीय मॉडल ( ) लागू करने की कोशिश कर रहा हूं जो शून्य से कम मान नहीं ले सकता है, शून्य-फुला हुआ है और निरंतर है। मान 0 से लेकर 0.25 तक होता है। परिणामस्वरूप, मॉडल के …


2
विचरण की रैखिकता
मुझे लगता है कि निम्नलिखित दो सूत्र सत्य हैं: Var(aX)=a2Var(X)Var(aX)=a2Var(X) \mathrm{Var}(aX)=a^2 \mathrm{Var}(X) , जबकि एक एक निरंतर संख्या है Var(X+Y)=Var(X)+Var(Y)Var(X+Y)=Var(X)+Var(Y) \mathrm{Var}(X + Y)=\mathrm{Var}(X)+\mathrm{Var}(Y) यदिXXX ,YYY स्वतंत्र हैं हालांकि, मुझे यकीन नहीं है कि नीचे के साथ क्या गलत है: जो नहीं है के बराबर 2 2 वी एक आर ( …

3
विवादास्पद विश्लेषण बनाम लॉजिस्टिक प्रतिगमन
मुझे भेदभावपूर्ण विश्लेषण के कुछ पेशेवरों का पता चला है और मुझे उनके बारे में प्रश्न मिले हैं। इसलिए: जब कक्षाएं अच्छी तरह से अलग हो जाती हैं, तो लॉजिस्टिक प्रतिगमन के लिए पैरामीटर अनुमान आश्चर्यजनक रूप से अस्थिर हैं। गुणांक अनंत तक जा सकते हैं। LDA इस समस्या से …

1
भारित यादृच्छिक वन के लिए आर पैकेज? classwt विकल्प?
मैं एक अत्यंत असंतुलित डेटा सेट के परिणाम की भविष्यवाणी करने के लिए रैंडम फ़ॉरेस्ट का उपयोग करने की कोशिश कर रहा हूं (अल्पसंख्यक वर्ग की दर लगभग 1% या उससे कम है)। क्योंकि पारंपरिक रैंडम फ़ॉरेस्ट एल्गोरिथ्म अल्पसंख्यक वर्गों पर विशेष ध्यान देने के बजाय समग्र त्रुटि दर को …
16 r  random-forest 

1
सांख्यिकीय शिक्षण सिद्धांत में, एक परीक्षण सेट पर ओवरफ़िटिंग की समस्या नहीं है?
आइए MNIST डेटासेट को वर्गीकृत करने के बारे में समस्या पर विचार करें। Yann LeCun के MNIST वेबपेज के अनुसार , 'Ciresan et al।' कन्वेंशनल न्यूरल नेटवर्क का उपयोग करके MNIST टेस्ट सेट पर 0.23% त्रुटि दर मिली। मान लें कि MNIST प्रशिक्षण सेट को , MNIST परीक्षण सेट रूप …

3
क्या वास्तव में एक वितरण है?
मैं संभाव्यता और सांख्यिकी के बारे में बहुत कम जानता हूं, और सीखने की इच्छा रखता हूं। मुझे "वितरण" शब्द सभी जगह अलग-अलग संदर्भों में इस्तेमाल होता है। उदाहरण के लिए, एक असतत यादृच्छिक चर में "संभाव्यता वितरण" होता है। मुझे पता है कि यह क्या है। एक सतत यादृच्छिक …

2
ची-स्क्वायर अच्छाई-के-फिट परीक्षण के लिए पोस्ट-हॉक टेस्ट
मैं तीन श्रेणियों के साथ ची-स्क्वायर नेकनेस-ऑफ-फिट (GOF) टेस्ट आयोजित कर रहा हूं और विशेष रूप से अशक्तता का परीक्षण करना चाहता हूं कि प्रत्येक श्रेणी में जनसंख्या अनुपात समान है (अर्थात, अनुपात प्रत्येक समूह में 1/3 है): OBSERVED डेटा समूह 1 समूह 2 समूह 3 कुल 686 928 1012 …

3
एक पर्याप्त आंकड़े में पैरामीटर के किसी भी अनुमान की गणना करने के लिए आवश्यक सभी जानकारी क्यों होती है?
मैंने अभी-अभी आँकड़ों का अध्ययन शुरू किया है और मुझे पर्याप्तता की सहज समझ नहीं मिल पा रही है। अधिक सटीक होने के लिए मैं यह नहीं समझ सकता कि कैसे दिखाया जाए कि निम्नलिखित दो पैराग्राफ बराबर हैं: मोटे तौर पर, एक अज्ञात पैरामीटर पर सशर्त रूप से वितरित …

1
"आराम से लासो" को मानक लासो से अलग क्यों किया जाता है?
यदि हम डेटा सेट से शुरू करते हैं , तो इसके लिए Lasso को लागू करें और β L का समाधान प्राप्त करें , हम Lasso को फिर से डेटा सेट ( X S , Y ) पर लागू कर सकते हैं , जहां S , गैर-शून्य का सेट है …

2
जीएलएम एक परिवर्तनीय चर के साथ एलएम से अलग क्यों है
जैसा कि इस कोर्स हैंडआउट (पेज 1) में बताया गया है , एक रेखीय मॉडल को फॉर्म में लिखा जा सकता है: y=β1x1+⋯+βpxp+εi,y=β1x1+⋯+βpxp+εi, y = \beta_1 x_{1} + \cdots + \beta_p x_{p} + \varepsilon_i, जहाँ yyy प्रतिक्रिया चर है और xixix_{i} , ithithi^{th} व्याख्यात्मक चर है। अक्सर परीक्षण मान्यताओं को …

1
दंडित प्रतिगमन में संकोचन पैरामीटर के लिए संभावित मानों की विशिष्ट सीमा क्या है?
लासो या रिज रिग्रेशन में, एक संकोचन पैरामीटर को निर्दिष्ट करना होता है, जिसे अक्सर या द्वारा कहा जाता है । यह मान अक्सर क्रॉस सत्यापन के माध्यम से चुना जाता है प्रशिक्षण डेटा पर विभिन्न मूल्यों का एक गुच्छा की जाँच करके और देखने के लिए कि परीक्षण डेटा …

2
ACF और PACF निरीक्षण के माध्यम से ARMA गुणांक का अनुमान लगाएं
आप ACF और PACF भूखंडों के दृश्य निरीक्षण द्वारा समय श्रृंखला के लिए उपयुक्त पूर्वानुमान मॉडल का अनुमान कैसे लगाते हैं? कौन सा (यानी, ACF या PACF) AR या MA को बताता है (या वे दोनों करते हैं)? ग्राफ़ का कौन सा भाग आपको मौसमी ARIMA के लिए मौसमी और …

1
क्या GLM में लॉग लाइबिलिटी ने वैश्विक मैक्सिमा के अभिसरण की गारंटी दी है?
मेरे प्रश्न हैं: क्या सामान्यीकृत रैखिक मॉडल (GLM) को वैश्विक अधिकतम में परिवर्तित करने की गारंटी है? यदि हां, तो क्यों? इसके अलावा, उत्तलता का बीमा करने के लिए लिंक समारोह में क्या अड़चनें हैं? GLMs के बारे में मेरी समझ यह है कि वे एक अत्यधिक नॉनलाइनियर संभावना फ़ंक्शन …

2
आर में "हाथ से" AIC की गणना
मैंने R में एक रेखीय प्रतिगमन के AIC की गणना करने की कोशिश की है, लेकिन AICइस तरह से फ़ंक्शन का उपयोग किए बिना : lm_mtcars <- lm(mpg ~ drat, mtcars) nrow(mtcars)*(log((sum(lm_mtcars$residuals^2)/nrow(mtcars))))+(length(lm_mtcars$coefficients)*2) [1] 97.98786 हालाँकि, AICएक अलग मूल्य देता है: AIC(lm_mtcars) [1] 190.7999 क्या कोई मुझे बता सकता है कि …

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.