सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

3
आंशिक कम से कम वर्गों (पीएलएस) प्रतिगमन की मॉडल धारणाएं
मैं पीएलएस प्रतिगमन (एकल ) की मान्यताओं के बारे में जानकारी खोजने की कोशिश कर रहा हूं । मैं विशेष रूप से पीएलएस की मान्यताओं की तुलना में ओएलएस प्रतिगमन के संबंध में रुचि रखता हूं। yyy मैंने पीएलएस के विषय पर साहित्य का एक बड़ा भाग पढ़ा / स्किम्ड …

1
कॉची वितरण में स्थान पैरामीटर का MLE
केंद्रित करने के बाद, दो माप x और ingx को संभावित घनत्व समारोह के साथ कॉची वितरण से स्वतंत्र अवलोकन माना जा सकता है: f(x:θ)=f(x:θ)=f(x :\theta) = 1π(1+(x−θ)2)1π(1+(x−θ)2)1\over\pi (1+(x-\theta)^2) ,−∞&lt;x&lt;∞,−∞&lt;x&lt;∞, -∞ < x < ∞ यह दिखाएं कि यदि का MLE of the 0 है, लेकिन यदि में दो MLE …

2
डेटा लगाने में पड़ोसी जानकारी का उपयोग करना या ऑफ-डेटा (आर में) खोजना।
मेरे पास इस धारणा के साथ डेटासेट है कि निकटतम पड़ोसी सर्वश्रेष्ठ भविष्यवक्ता हैं। बस दो तरफा ढाल का एक आदर्श उदाहरण है- मान लीजिए कि हमारे पास ऐसा मामला है जहां कुछ मूल्य गायब हैं, हम आसानी से पड़ोसियों और प्रवृत्ति के आधार पर भविष्यवाणी कर सकते हैं। आर …

2
क्या कोलमोगोरोव-स्मिरनोव परीक्षण का एक सरल तुल्यता परीक्षण संस्करण है?
क्या समतुल्यता के लिए दो-तरफा परीक्षण (TOST) को कोमोगोरोव-स्मिरनोव परीक्षण के लिए नकारात्मक नकारात्मक परिकल्पना का परीक्षण करने के लिए तैयार किया गया है कि दो वितरण कम से कम कुछ शोधकर्ता-निर्दिष्ट स्तर से भिन्न हैं ? यदि TOST नहीं, तो समतुल्यता परीक्षण के कुछ अन्य रूप? निक स्टैनर बुद्धिमानी …

3
Be सीलिंग इफेक्ट ’होने के लिए क्या मापदंड पूरे होने चाहिए?
सामाजिक विज्ञान अनुसंधान विधियों के विशाल विश्वकोश के अनुसार … [ए] सीलिंग प्रभाव तब होता है जब एक उपाय संभावित प्रतिक्रियाओं के लिए एक अलग ऊपरी सीमा रखता है और प्रतिभागियों की एक बड़ी एकाग्रता इस सीमा पर या उसके आसपास स्कोर करती है। स्केल क्षीणन एक पद्धतिगत समस्या है …

3
बहु-स्तरीय / श्रेणीबद्ध-संरचित डेटा पर यादृच्छिक वन
मैं मशीन लर्निंग, कार्ट-तकनीक और पसंद करने के लिए काफी नया हूं, और मुझे उम्मीद है कि मेरा भोलापन बहुत स्पष्ट नहीं है। रैंडम फ़ॉरेस्ट मल्टी-लेवल / पदानुक्रमित डेटा संरचनाओं को कैसे संभालता है (उदाहरण के लिए जब क्रॉस-लेवल इंटरेक्शन रुचि का हो)? यही है, डेटा कई पदानुक्रमित स्तरों पर …

1
पीसीए लोडिंग की व्याख्या कैसे करें?
पीसीए के बारे में पढ़ते हुए, मैं निम्नलिखित स्पष्टीकरण पर आया: मान लें कि हमारे पास एक डेटा सेट है जहां प्रत्येक डेटा बिंदु एक गणित परीक्षा, एक भौतिकी परीक्षण, एक पढ़ने की समझ परीक्षण और एक शब्दावली परीक्षण पर एक एकल छात्र के अंकों का प्रतिनिधित्व करता है। हम …
13 pca 

3
अनिश्चितताओं के साथ कई मापों का मानक विचलन
मेरे पास 1 हर्ट्ज (7200 माप) के नमूने दर के साथ दो 2 घंटे का जीपीएस डेटा है। डेटा फॉर्म , जहाँ माप अनिश्चितता है।एन σ( एक्स), एक्सσ, वाई, वाईσ, जेड, जेडσ)(X,Xσ,Y,Yσ,Z,Zσ)(X, X_\sigma, Y, Y_\sigma, Z, Z_\sigma)एनσNσN_\sigma जब मैं सभी मापों (जैसे कि उन दो घंटों का औसत Z मान) …

1
समर्पण में अत्याधुनिक
रिकॉर्ड कटौती में अत्याधुनिक तरीके क्या हैं? Deduplication को कभी-कभी कहा भी जाता है: रिकॉर्ड लिंकेज, इकाई संकल्प, पहचान संकल्प, मर्ज / पर्ज। मैं CBLOCK के बारे में उदाहरण के लिए जानता हूं [1]। मैं सराहना करूंगा यदि उत्तर में मौजूदा सॉफ्टवेयर के संदर्भ भी शामिल हैं जो विधियों को …

4
सभी ज्ञात वितरण असमान क्यों हैं?
मैं किसी भी मल्टीमॉडल वितरण को नहीं जानता हूं। सभी ज्ञात वितरण असमान क्यों हैं? क्या कोई "प्रसिद्ध" वितरण है जिसमें एक से अधिक मोड हैं? बेशक, वितरण के मिश्रण अक्सर मल्टीमॉडल होते हैं, लेकिन मैं यह जानना चाहूंगा कि क्या कोई "गैर-मिश्रण" वितरण मौजूद है जिसमें एक से अधिक …

2
ज्यामितीय वितरण और हाइपरजोमेट्रिक वितरण को ऐसे क्यों कहा जाता है?
क्यों कर रहे हैं ज्यामितीय वितरण और hypergeometric वितरण "ज्यामितीय" और "hypergoemetric" कहा जाता है क्रमशः? क्या इसलिए कि उनके pmfs कुछ विशेष रूप लेते हैं? धन्यवाद!

1
जब मॉडल को स्केल किए गए डेटा के साथ फिट किया गया था, तो भविष्यवाणियां करने के लिए नई टिप्पणियों को कैसे स्केल किया जाए?
मैं रेखीय प्रतिगमन मॉडल में उपयोग करने के लिए डेटा मैट्रिक्स को स्केल करने की अवधारणा को समझता हूं। उदाहरण के लिए, R में आप उपयोग कर सकते हैं: scaled.data &lt;- scale(data, scale=TRUE) मेरा एकमात्र प्रश्न यह है कि नई टिप्पणियों के लिए, जिनके लिए मैं आउटपुट मानों की भविष्यवाणी …

1
क्यों अवरोधन की मानक त्रुटि बढ़ जाता है आगे 0 से है?
अवरोधन शब्द ( ) की मानक त्रुटि में जहां है का मतलब है ।y=β1एक्स+β0+εएसई( β 0)2=σ2[1β^0β^0\hat{\beta}_0y=β1x+β0+εy=β1x+β0+εy=\beta_1x+\beta_0+\varepsilonixxiSE(β^0)2=σ2[1n+x¯2∑ni=1(xi−x¯)2]SE(β^0)2=σ2[1n+x¯2∑i=1n(xi−x¯)2]SE(\hat{\beta}_0)^2 = \sigma^2\left[\frac{1}{n}+\frac{\bar{x}^2}{\sum_{i=1}^n(x_i-\bar{x})^2}\right]x¯x¯\bar{x}xixix_i मैं जो समझता हूं, एसई आपकी अनिश्चितता को उदाहरण के लिए, 95% नमूनों में, अंतराल में true शामिल । मैं यह समझने में असफल रहा कि एसई, अनिश्चितता का एक उपाय, साथ …

3
अत्यंत तिरछे वितरण को बदलना
मान लें कि मेरे पास एक चर है जिसका वितरण सकारात्मक रूप से बहुत अधिक डिग्री तक तिरछा है, जैसे कि सामान्य वितरण के लिए तिरछापन की सीमा के भीतर लाने के लिए लॉग लेना पर्याप्त नहीं होगा। इस बिंदु पर मेरे विकल्प क्या हैं? चर को सामान्य वितरण में …

1
सामान्यीकृत रैखिक मॉडल की ज्यामितीय व्याख्या
के लिए रेखीय मॉडल :, हम OLS के माध्यम से अनुमान मॉडल का एक अच्छा ज्यामितीय व्याख्या हो सकती है y = एक्स β + ई । Y y के प्रक्षेपण पर अंतरिक्ष एक्स और अवशिष्ट से फैला है ई सीधा है करने के लिए इस अंतरिक्ष एक्स से फैला।y= …

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.