सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

2
दो * सहसंबद्ध * सामान्य चर का उदाहरण जिसका योग सामान्य नहीं है
मैं सहसंबद्ध यादृच्छिक चर के जोड़े के कुछ अच्छे उदाहरणों से अवगत हूं जो कि सामान्य रूप से सामान्य हैं लेकिन संयुक्त रूप से सामान्य नहीं हैं। देखें इस जवाब से दिलीप Sarwate , और यह एक द्वारा कार्डिनल । मैं दो सामान्य यादृच्छिक चर के उदाहरण से भी अवगत …

1
यादृच्छिक ढलानों के साथ मिश्रित मॉडल में इंट्राक्लास सहसंबंध गुणांक
मेरे पास प्रतिभागियों ( ) और वस्तुओं ( ) के लिए बेतरतीब ढंग से पार किए गए प्रभावों से m_plotसुसज्जित निम्नलिखित मॉडल हैं :lme4::lmerlfdncontent Random effects: Groups Name Variance Std.Dev. Corr lfdn (Intercept) 172.173 13.121 role1 62.351 7.896 0.03 inference1 24.640 4.964 0.08 -0.30 inference2 52.366 7.236 -0.05 0.17 -0.83 …

1
क्या यह सांख्यिकीय रूप से दिखाया जा सकता है कि कारों को हत्या के हथियार के रूप में उपयोग किया जाता है?
मैंने हाल ही में एक कहानी सुनी, जिसमें किसी ने कहा कि अगर वे किसी को मारना चाहते हैं (और इसके साथ भाग जाते हैं) तो वे इसे अपनी कार के साथ करेंगे। उन्होंने ऑटो से संबंधित मौतों की संख्या (कार-पर-पैदल यात्रियों सहित) के बारे में विभिन्न आंकड़ों का हवाला …

1
रैंडम फ़ॉरेस्ट ओवरफ़िट नहीं कर सकता?
मैंने कुछ साहित्य पढ़ा है कि यादृच्छिक वन ओवरफिट नहीं कर सकते हैं। जबकि यह बहुत अच्छा लगता है, यह सच होना बहुत अच्छा लगता है। क्या rf की ओवरफिट करना संभव है?

3
2-गॉसियन मिक्स मॉडल एमसीसीएमसी और पायएमसी के साथ अनुमान
समस्या मैं एक साधारण 2-गाऊसी मिश्रण आबादी के मॉडल मापदंडों को फिट करना चाहता हूं। Bayesian तरीकों के आसपास सभी प्रचार को देखते हुए मैं यह समझना चाहता हूं कि क्या इस समस्या के लिए Bayesian inference एक बेहतर उपकरण है जो पारंपरिक फिटिंग के तरीके हैं। अब तक MCMC …

2
छोटे नमूने-आकार के डेटा के लिए प्रशिक्षण, क्रॉस-सत्यापन, और परीक्षण सेट आकार कैसे चुनें?
मान लें कि मेरे पास एक छोटा नमूना आकार है, जैसे कि एन = 100, और दो वर्ग। मुझे मशीन लर्निंग के लिए प्रशिक्षण, क्रॉस-सत्यापन, और परीक्षण सेट आकार कैसे चुनना चाहिए? मैं सहजता से चुनूंगा प्रशिक्षण सेट आकार 50 के रूप में क्रॉस सत्यापन सेट आकार 25, और 25 …

2
पियर्सन के ची स्क्वैयरेड स्टैटिस्टिक अनुमानित एक ची स्क्वेरड वितरण कैसे करता है
इसलिए यदि पियर्सन के ची स्क्वेरड स्टैटिस्टिक को तालिका के लिए दिया जाता है , तो इसका रूप है:1×N1×N1 \times N ∑i=1n(Oi−Ei)2Ei∑i=1n(Oi−Ei)2Ei\sum_{i=1}^n\frac{(O_i - E_i)^2}{E_i} इसके बाद यह , ची-चुकता वितरण को डिग्री स्वतंत्रता के साथ अनुमानित करता है, क्योंकि नमूना आकार बड़ा हो जाता है। χ2n−1χn−12\chi_{n-1}^2n−1n−1n-1NNN मुझे समझ में नहीं …

2
R randomForests में वर्गीकरण के लिए थ्रेसहोल्ड कैसे बदलें?
सभी स्पीशीज डिस्ट्रीब्यूशन मॉडलिंग साहित्य से पता चलता है कि जब किसी ऐसे मॉडल का उपयोग करते हुए प्रजातियों की मौजूदगी / अनुपस्थिति की भविष्यवाणी की जाती है, जो संभाव्यता (उदाहरण के लिए, रैंडमफॉरेस्ट्स) का उपयोग करते हैं, तो थ्रेशोल्ड प्रोबेबिलिटी का चुनाव जिसके द्वारा वास्तव में उपस्थिति या अनुपस्थिति …

1
एक घातांक-भारित माध्य का मानक विचलन
मैंने पायथन में एक साधारण कार्य लिखा है जिसका मतलब है कि तेजी से भारित माध्य की गणना करें: def test(): x = [1,2,3,4,5] alpha = 0.98 s_old = x[0] for i in range(1, len(x)): s = alpha * x[i] + (1- alpha) * s_old s_old = s return s …

2
गैर-नेस्टेड मॉडल के लिए सामान्यीकृत लॉग संभावना अनुपात परीक्षण
मैं समझता हूं कि अगर मेरे दो मॉडल ए और बी हैं और ए को बी में नेस्टेड किया गया है, तो कुछ डेटा को देखते हुए, मैं एमएलई का उपयोग करके ए और बी के मापदंडों को फिट कर सकता हूं और सामान्यीकृत लॉग संभावना अनुपात परीक्षण लागू कर …

1
बैगिंग बूटस्ट्रैप नमूनों का उपयोग क्यों करता है?
बैगिंग एन अलग बूटस्ट्रैप नमूनों पर एन शिक्षार्थियों को बनाने की प्रक्रिया है, फिर उनकी भविष्यवाणियों का मतलब ले रहा है। मेरा प्रश्न है: किसी अन्य प्रकार के नमूने का उपयोग क्यों न करें? बूटस्ट्रैप नमूनों का उपयोग क्यों करें?
10 bagging 

2
बेतरतीब मॉडल के लिए कैरेट varImp
मुझे यह समझने में परेशानी हो रही है कि पैकेज के varImpसाथ यादृच्छिक यादृच्छिक मॉडल के लिए फ़ंक्शन कैसे काम करता है caret। नीचे दिए गए उदाहरण में सुविधा var3 को कैरेट के varImpफ़ंक्शन का उपयोग करके शून्य महत्व मिलता है , लेकिन अंतर्निहित randomForest अंतिम मॉडल में सुविधा var3 …
10 r  caret  random-forest 

4
अनियमित समय श्रृंखला के लिए डायनामिक टाइम वार्निंग
मैं हाल ही में डायनामिक टाइम वार्पिंग (DTW) के बारे में बहुत कुछ पढ़ रहा हूं। मुझे बहुत आश्चर्य है कि अनियमित समय श्रृंखला के लिए DTW के आवेदन पर कोई साहित्य नहीं है, या कम से कम मुझे यह नहीं मिला। क्या कोई मुझे उस मुद्दे से संबंधित किसी …

2
अंतर के साथ हस्तक्षेप
जब समय श्रृंखला डेटा (उर्फ बाधित समय श्रृंखला) के साथ एक हस्तक्षेप विश्लेषण का आयोजन किया जाता है, उदाहरण के लिए यहां एक आवश्यकता के रूप में चर्चा की गई है, तो मुझे हस्तक्षेप के कारण कुल लाभ (या हानि) का अनुमान लगाना है - अर्थात इकाइयों की संख्या में …

1
क्या होल्ड-आउट सत्यापन k- गुना CV की तुलना में "नया डेटा प्राप्त करने" का एक बेहतर सन्निकटन है?
मैं एक जवाब दे रहा हूं जो मैंने कुछ हफ्ते पहले एक सवाल पर दिया था होल्ड-आउट क्रॉस-सत्यापन एक एकल परीक्षण सेट का उत्पादन करता है जिसे प्रदर्शन के लिए बार-बार उपयोग किया जा सकता है। हम सभी सहमत हैं कि यह कई मायनों में एक नकारात्मक विशेषता है, क्योंकि …

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.