सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

3
द्विपद प्रभाव आकार प्रदर्शन (BESD) प्रभाव आकार का एक भ्रामक प्रतिनिधित्व है?
मेरे लिए यह स्वीकार करना कठिन है कि डोनाल्ड रुबिन कभी भी एक तकनीक के सच्चे नींबू के साथ आएगा। फिर भी, यह BESD [ 1 , 2 , 3 ] की मेरी धारणा है । रोसेन्थल और रुबिन (1982) के मूल पेपर ने दावा किया कि "किसी भी उत्पाद-पल …

3
रैखिक मॉडल Heteroscedasticity
मेरे पास निम्न रैखिक मॉडल है: अवशेषों को सम्‍मिलित करने के लिए मैंने आश्रित चर पर एक परिवर्तन को रूप में लागू करने की कोशिश की है, लेकिन मुझे अभी भी अवशेषों पर समान प्रशंसक प्रभाव दिखाई देता है। DV मान अपेक्षाकृत छोटा है इसलिए लॉग लेने से पहले +1 …

2
जब समय के साथ परिवर्तन का अनुमान लगाया जा रहा है तो गॉसियन प्रक्रिया प्रतिगमन कैसे करें?
जब मैं समय के साथ अनुमानित परिवर्तनों की कोशिश कर रहा हूं, तो गॉसियन प्रक्रिया प्रतिगमन करने के लिए अच्छी रणनीति क्या है? मेरे दिमाग में आने वाले भोले दृष्टिकोण केवल प्रतिगमन करने के लिए एन सबसे हाल के डेटा बिंदुओं का उपयोग करना है। बेहतर रणनीतियां क्या हैं?

1
SEM मॉडलिंग (OpenMx, पॉलीकोर) के साथ मदद
मुझे एक डेटा सेट के साथ बहुत समस्या है जिसके लिए मैं SEM को लागू करने का प्रयास कर रहा हूं। हम संकेतक के सम्मान के साथ 5 अव्यक्त कारकों ए, बी, सी, डी, ई के अस्तित्व को मानते हैं। ए 1 से ए 5 (ऑर्डर किए गए कारक), बी …

3
अनियमित अंतराल पर एकत्रित डेटा के आधार पर पूर्वानुमान कैसे लगाया जाए?
मैं वेंडिंग मशीन में उत्पादों की बिक्री का पूर्वानुमान लगाने की कोशिश कर रहा हूं। समस्या यह है कि मशीन अनियमित अंतराल पर भरी हुई है और प्रत्येक भराव पर हम मशीन के अंतिम भरण (यानी हमारे पास दैनिक बिक्री डेटा नहीं है) के बाद से एकत्र बिक्री को रिकॉर्ड …

1
फिशर गुठली से परे
कुछ समय के लिए, ऐसा लग रहा था कि फिशर कर्नेल लोकप्रिय हो सकते हैं, क्योंकि वे संभावित मॉडल से गुठली बनाने का एक तरीका प्रतीत हो रहे थे। हालांकि, मैंने शायद ही कभी उन्हें अभ्यास में इस्तेमाल करते देखा है, और मेरे पास यह अच्छा अधिकार है कि वे …

1
बहुत बड़ी समय-श्रृंखला डेटासेट से निपटना
मेरी पहुंच बहुत बड़े डेटासेट तक है। डेटा चार लोगों में से एक से संगीत अंश सुनने वाले एमईजी रिकॉर्डिंग से है। डेटा इस प्रकार है: 6 विषय 3 प्रायोगिक दोहराव (युग) 120 परीक्षण प्रति युग 275 MEG चैनलों से 500Hz (= 4000 नमूने) पर परीक्षण के अनुसार 8 सेकंड …

3
विशाल डेटासेट से सीखते समय दृष्टिकोण?
मूल रूप से, विशाल डेटासेट के खिलाफ सीखने के दो सामान्य तरीके हैं (जब आप समय / स्थान प्रतिबंधों का सामना करते हैं): धोखा :) - प्रशिक्षण के लिए सिर्फ एक "प्रबंधनीय" सबसेट का उपयोग करें। घटते रिटर्न के कानून की वजह से सटीकता की हानि नगण्य हो सकती है …

3
स्वचालित डेटा सफाई
एक आम समस्या है एमएल डेटा की खराब गुणवत्ता: फीचर वैल्यू में त्रुटियां, मिसकॉलिफाइड इंस्टेंस आदि। इस समस्या को संबोधित करने का एक तरीका मैन्युअल रूप से डेटा और जांच के माध्यम से जाना है, लेकिन क्या अन्य तकनीकें हैं? (मुझे यकीन है कि वहाँ हैं!) कौन से बेहतर हैं …

1
क्या MFCC एक पुनर्प्राप्ति प्रणाली के लिए संगीत का प्रतिनिधित्व करने का इष्टतम तरीका है?
एक सिग्नल प्रोसेसिंग तकनीक, मेल फ़्रीक्वेंसी सेफस्ट्रम , का उपयोग अक्सर मशीन लर्निंग कार्य में उपयोग के लिए एक संगीत टुकड़े से जानकारी निकालने के लिए किया जाता है। यह विधि एक अल्पकालिक बिजली स्पेक्ट्रम देती है, और गुणांक इनपुट के रूप में उपयोग किया जाता है। म्यूजिक रिट्रीवल सिस्टम …

3
जब आरएम का अनुमानित मूल्य में कोई भिन्नता नहीं है, तो आर ^ 2 मान (और इसे क्या निर्धारित कर रहा है) क्यों है?
निम्नलिखित आर कोड पर विचार करें: example <- function(n) { X <- 1:n Y <- rep(1,n) return(lm(Y~X)) } #(2.13.0, i386-pc-mingw32) summary(example(7)) #R^2 = .1963 summary(example(62)) #R^2 = .4529 summary(example(4540)) #R^2 = .7832 summary(example(104))) #R^2 = 0 #I did a search for n 6:10000, the result for R^2 is NaN for …
10 r  regression 

3
बार-बार उपाय संरचनात्मक समीकरण मॉडलिंग
मुझे नैदानिक ​​पुनर्वास डेटा के डेटासेट का विश्लेषण करने की आवश्यकता है। मुझे मात्रात्मक "इनपुट" (चिकित्सा की मात्रा) और स्वास्थ्य की स्थिति में परिवर्तन के बीच परिकल्पना संचालित संबंधों में दिलचस्पी है। हालांकि डेटासेट अपेक्षाकृत छोटा है (n ~ 70) हम दोनों में अस्थायी परिवर्तन को दर्शाते हुए डेटा दोहराया …

2
ची-वर्ग के लिए आत्मविश्वास अंतराल
मैं दो "अच्छाई-से-फिट ची-वर्ग" परीक्षणों की तुलना करने के लिए एक समाधान खोजने की कोशिश कर रहा हूं। अधिक सटीक रूप से, मैं दो स्वतंत्र प्रयोगों के परिणामों की तुलना करना चाहता हूं। इन प्रयोगों में लेखकों ने मनाया आवृत्तियों के साथ यादृच्छिक अनुमान लगाने (अपेक्षित आवृत्तियों) की तुलना करने …

4
सांख्यिकीय सिमुलेशन की व्याख्या
मैं सांख्यिकीविद् नहीं हूं। इसलिए, यदि कोई हो, तो कृपया मेरे दोषों को सहन करें। क्या आप सरल तरीके से समझाएंगे कि अनुकरण कैसे किया जाता है? मुझे पता है कि यह सामान्य वितरण से कुछ यादृच्छिक नमूना चुनता है और अनुकरण के लिए उपयोग करता है। लेकिन, स्पष्ट रूप …
10 simulation 

4
आर में चर / सुविधा चयन करने के लिए क्रॉस सत्यापन का उपयोग करने का एक तरीका है?
मेरे पास लगभग 70 वैरिएबल के साथ एक डेटा सेट है जिसे मैं कट करना चाहूंगा। मैं जो करना चाह रहा हूं वह निम्नलिखित फैशन में सबसे उपयोगी चर खोजने के लिए सीवी का उपयोग करना है। 1) यादृच्छिक रूप से 20 वेरिएबल्स का चयन करें। 2) सबसे महत्वपूर्ण चर …

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.