सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

1
रिज रिग्रेशन का परिणाम lm.ridge और glmnet का उपयोग करने में भिन्न होता है
मैंने आर। में रिज रिग्रेशन का उपयोग करते हुए प्रतिगमन मॉडल का सबसे अच्छा चर समाधान खोजने के लिए कुछ डेटा लागू किया था। मैंने ( lm.ridgeऔर ) का उपयोग किया है , लेकिन परिणाम विशेष रूप से बहुत अलग हैं । यह मान लें कि दोनों पैरामीटर अनुमानकों में …

5
संभावना है कि एक सतत यादृच्छिक चर एक निश्चित बिंदु मानता है
मैं एक परिचयात्मक सांख्यिकी वर्ग में हूं जिसमें निरंतर यादृच्छिक चर के लिए प्रायिकता घनत्व फ़ंक्शन में रूप में परिभाषित किया गया है । मैं समझता हूँ कि का अभिन्न अंग है लेकिन मैं इसे निरंतर यादृच्छिक चर के अपने अंतर्ज्ञान के साथ ठीक नहीं कर सकता। Say X ट्रेन …

1
एक और परीक्षण के परिणाम के आधार पर परिकल्पना परीक्षण करने पर कागज
यह सर्वविदित है कि किसी अन्य सांख्यिकीय परीक्षण के परिणाम के आधार पर एक सांख्यिकीय परीक्षा का चयन करना समस्याग्रस्त है, क्योंकि पी-मानों की व्याख्या करना असंभव है (उदाहरण के लिए, अन्य के परिणाम के आधार पर एक सांख्यिकीय परीक्षण चुनना) (जैसे सामान्यता ) । हालाँकि, यह अभी भी कई …

1
भविष्यवाणी अंतराल = विश्वसनीय अंतराल?
मैं सोच रहा हूँ कि क्या भविष्यवाणी अंतराल और विश्वसनीय अंतराल एक ही चीज़ का मूल्यांकन करते हैं। उदाहरण के लिए, लीनियर रिग्रेशन के साथ, जब आप किसी फिटेड वैल्यू के पूर्वानुमान अंतराल का अनुमान लगाते हैं, तो आप अनुमान लगाते हैं कि अंतराल की सीमा जिसमें आप अपने मूल्य …

1
सिग्माइड वक्र के सीधे हिस्से के ढलान का अनुमान
मुझे यह कार्य दिया गया है और स्टम्प्ड किया गया था। एक सहयोगी ने मुझे निम्नलिखित चार्ट के और का अनुमान लगाने के लिए कहा : x l o w e r rएक्सयू पी पी ई आरएक्सयूपीपीइआरx_{upper}एक्सl o w e r rएक्सएलओwइआरx_{lower} वक्र वास्तव में एक संचयी वितरण है, और …

1
पदानुक्रमित गामा-पॉइसन मॉडल के लिए हाइपरपेयर घनत्व
डेटा एक पदानुक्रमित मॉडल में जहां यह चुने गए मूल्यों के व्यवहार में विशिष्ट प्रतीत होता है ( ऐसा है कि गामा वितरण के माध्य और विचरण मोटे तौर पर डेटा (जैसे, क्लेटन और कलडोर, 1987 के माध्य और विचरण) से मेल खाते हैं "रोग-मानचित्रण के लिए आयु-मानकीकृत संबंधक अनुमानों …

2
क्या छोटे नमूनों के साथ यादृच्छिककरण विश्वसनीय है?
जेरोम कॉर्नफील्ड ने लिखा है: फिशरियन क्रांति का सबसे अच्छा फल यादृच्छिककरण का विचार था, और कुछ अन्य चीजों पर सहमत होने वाले सांख्यिकीविदों ने कम से कम इस पर सहमति व्यक्त की है। लेकिन इस समझौते के बावजूद और नैदानिक ​​और प्रयोग के अन्य रूपों में यादृच्छिक आवंटन प्रक्रियाओं …

1
R (tsboot, MannKendall) में किए गए बूटस्ट्रैप के आउटपुट को समझना
मेरे पास आर। में tsboot कॉल की व्याख्या के बारे में एक प्रश्न है। मैंने केंडल और बूट पैकेज दोनों के प्रलेखन की जांच की, लेकिन मैं पहले से ज्यादा चालाक नहीं हूं। जब मैं केंडल पैकेज में उदाहरण के लिए बूटस्ट्रैप का उपयोग करता हूं, जहां परीक्षण आँकड़ा केंडल …
11 r  bootstrap 

2
"स्टेप वाइज रिग्रेशन" कैसे काम करता है?
मैंने प्रोबेट मॉडल को फिट करने के लिए निम्नलिखित आर कोड का उपयोग किया: p1 <- glm(natijeh ~ ., family=binomial(probit), data=data1) stepwise(p1, direction='backward/forward', criterion='BIC') मुझे पता है कि क्या करता है चाहते हैं stepwiseऔर backward/forwardवास्तव में क्या करना है और कैसे चर का चयन?

2
BUGS / JAGS जैसे कार्यक्रम गिब्स नमूने के लिए सशर्त वितरण को स्वचालित रूप से कैसे निर्धारित करते हैं?
पूर्ण सशर्त जैसे लगता है अक्सर व्युत्पन्न करने के लिए काफी मुश्किल है, फिर भी JAGS और BUGS जैसे कार्यक्रम उन्हें स्वचालित रूप से प्राप्त करते हैं। क्या कोई समझा सकता है कि वे किसी भी मनमाने ढंग से मॉडल विनिर्देश के लिए एल्गोरिदम को पूरी तरह से कैसे उत्पन्न …

2
एकाधिक प्रतिसाद किए गए डेटासेट में किए गए परीक्षणों पर पूल किए गए पी-मान कैसे प्राप्त करें?
आर में अमेलिया का उपयोग करते हुए, मैंने कई प्रतिरूपित डेटासेट प्राप्त किए। उसके बाद, मैंने एसपीएसएस में दोहराया उपायों का परीक्षण किया। अब, मैं परिणामों का परीक्षण करना चाहता हूं। मुझे पता है कि मैं रुबिन के नियमों का उपयोग कर सकता हूं (आर में किसी भी कई प्रतिरूपण …

1
सटीक सत्यापन का उपयोग करें और क्रॉस सत्यापन का उपयोग करते समय याद रखें
मैंने 2-लेबल वाले डेटा के लिए कई क्लासिफ़ायर का उपयोग करके वर्गीकरण का प्रदर्शन किया है, और मैंने 5-गुना क्रॉस सत्यापन का उपयोग किया है। प्रत्येक तह के लिए मैंने tp, tn, fp और fn की गणना की। फिर मैंने प्रत्येक परीक्षण के लिए सटीकता, सटीक, याद और एफ-स्कोर की …

4
सामान्यीकृत बूस्ट रिग्रेशन मॉडल में पेड़ों की संख्या कैसे चुनें?
क्या GBM में पेड़ों की संख्या चुनने की कोई रणनीति है? विशेष रूप से, 's फ़ंक्शन ntreesमें तर्क ।Rgbm मैं नहीं देखता कि आपको ntreesउच्चतम उचित मूल्य पर सेट क्यों नहीं करना चाहिए । मैंने देखा है कि पेड़ों की एक बड़ी संख्या स्पष्ट रूप से कई जीबीएम से परिणामों …

2
नमूने के आकार में वृद्धि होने से आत्मविश्वास अंतराल किन स्थितियों में बेहतर नहीं होगा?
एक ब्लॉग पोस्ट में , मैंने दावा किया है कि "मुझे विश्वास है कि डब्ल्यूजी कोचरन पहला बिंदु बाहर (लगभग 1970)) है कि एक अवलोकन सेटिंग में विश्वास अंतराल के साथ, छोटे नमूने के आकार के परिणामस्वरूप शून्य कवरेज के पास उपलब्ध बड़े पर्याप्त नमूनों के साथ बेहतर कवरेज होता …

2
समय-श्रृंखला वर्गीकरण - बहुत खराब परिणाम
मैं एक समय श्रृंखला वर्गीकरण समस्या पर काम कर रहा हूं जहां सेल फोन खाते के पहले 21 दिनों के लिए इनपुट समय श्रृंखला आवाज उपयोग डेटा (सेकंड में) है। संबंधित लक्ष्य चर 35-45 दिन की सीमा में उस खाते को रद्द किया गया है या नहीं। तो यह एक …

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.