सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

4
भारी पूंछ वाले वितरण के लिए बॉक्सप्लॉट बराबर?
लगभग सामान्य रूप से वितरित किए गए डेटा के लिए, बॉक्सप्लाट्स डेटा के मध्यमान और प्रसार की कल्पना करने के साथ-साथ किसी भी आउटलेयर की उपस्थिति का एक शानदार तरीका है। हालांकि अधिक भारी-पूंछ वाले वितरणों के लिए, बहुत सारे बिंदुओं को आउटलेर्स के रूप में दिखाया गया है, क्योंकि …

3
फिशर का जेड-ट्रांसफॉर्म कब उचित है?
मैं महत्व के लिए एक नमूना सहसंबंध का परीक्षण करना चाहता हूं , जो कि p- मानों का उपयोग कर रहा हैआरrr एच0: ρ = 0 ,एच1: Ρ ≠ 0।H0:ρ=0,H1:ρ≠0.H_0: \rho = 0, \; H_1: \rho \neq 0. मैं समझ गया हूं कि मैं इसके द्वारा गणना करने के लिए …

2
रैखिक बनाम नॉनलाइनर प्रतिगमन
मेरे पास मानों का एक सेट है और जो सैद्धांतिक रूप से तेजी से संबंधित हैं:यएक्सxxyyy y= एक एक्सखy=axby = ax^b गुणांक प्राप्त करने का एक तरीका दोनों पक्षों में प्राकृतिक लघुगणक लागू करना और एक रैखिक मॉडल फिटिंग करना है: > fit <- lm(log(y)~log(x)) > a <- exp(fit$coefficients[1]) > …

1
जब अलग मॉडलिंग / सत्यापन सेट का उपयोग करके एक प्रतिगमन मॉडल का निर्माण किया जाता है, तो क्या सत्यापन डेटा को "पुन: प्रसारित" करना उचित है?
मान लीजिए कि मुझे मॉडलिंग / सत्यापन टिप्पणियों के बीच 80/20 का विभाजन मिला है। मैंने मॉडलिंग डेटा सेट के लिए एक मॉडल फिट किया है, और मैं उस त्रुटि के साथ सहज हूं जो मैं सत्यापन डेटा सेट पर देख रहा हूं। इससे पहले कि मैं भविष्य के अवलोकन …

3
दूसरे के परिणाम के आधार पर सांख्यिकीय परीक्षण चुनना (जैसे सामान्यता)
तो मैंने सुना है कि यह कहा गया है कि एक सांख्यिकीय परीक्षण को दूसरे के परिणाम के आधार पर चुनना एक अच्छा विचार नहीं है। हालांकि यह मुझे अजीब लगता है। उदाहरण के लिए, लोग अक्सर एक गैर पैरामीट्रिक परीक्षण का उपयोग करना चुनते हैं जब कुछ अन्य परीक्षण …

4
पैनल डेटा के साथ मैचिंग प्रॉपर्टीज स्कोर
मेरे पास व्यक्तियों का एक अनुदैर्ध्य डेटा सेट है और उनमें से कुछ एक उपचार के अधीन थे और अन्य नहीं थे। सभी व्यक्ति जन्म से लेकर 18 वर्ष की आयु तक के नमूने में हैं और इलाज उस सीमा के बीच में कुछ उम्र में होता है। उपचार की …

1
संरचनात्मक समीकरण: आर लावायन पैकेज में सहभागिता प्रभाव को कैसे निर्दिष्ट करें
मैं एक संरचनात्मक समीकरण मॉडल का अनुमान लगाने के लिए आर लवन पैकेज का उपयोग कर रहा हूं । मान लें कि मॉडल में 1 अव्यक्त और 2 प्रकट व्याख्यात्मक चर के साथ 1 अंतर्जात प्रकट चर होते हैं: group = {0,1} attitude1 = latent,scale age = respondent's age वांछित …
13 r  interaction  sem  lavaan 

1
पैनल डेटा मॉडल में एक समूह के भीतर मानकीकृत आश्रित चर?
क्या पहचान समूह के भीतर एक आश्रित चर का मानकीकरण समझ में आता है? निम्नलिखित कार्य पत्र (कानूनी अमेज़न में वंचन मंदी; मूल्य या नीतियाँ ?, pdf ) वनों की कटाई पर ब्राजील में सामान्य नीति परिवर्तन के प्रभाव का विश्लेषण करने के लिए एक मानकीकृत निर्भर चर का उपयोग …

2
रैंडम फ़ॉरेस्ट मॉडल का उपयोग करते समय अपने वेरिएबल्स को कब लॉग / एक्सप करें?
मैं कई विशेषताओं के आधार पर कीमतों की भविष्यवाणी करने के लिए यादृच्छिक वनों का उपयोग करके प्रतिगमन कर रहा हूं। कोड Scikit-learn का उपयोग करके पायथन में लिखा गया है। आप कैसे तय करते हैं कि आपको प्रतिगमन मॉडल को फिट करने के लिए उपयोग करने से पहले exp/ …

3
आर में varimax- घुमाए गए प्रमुख घटकों की गणना कैसे करें?
मैंने 25 चर पर पीसीए चलाया और शीर्ष 7 पीसी का चयन किया prcomp। prc <- prcomp(pollutions, center=T, scale=T, retx=T) मैंने तब उन घटकों पर वरीमैक्स रोटेशन किया है। varimax7 <- varimax(prc$rotation[,1:7]) और अब मैं पीसीए-रोटेट किए गए डेटा को बारी बारी से करना चाहता हूं (क्योंकि यह वेरिमैक्स ऑब्जेक्ट …
13 r  pca  factor-rotation 

4
इन्फ्लूएंजा डेटा का प्रक्षेप जो साप्ताहिक माध्य का संरक्षण करता है
संपादित करें मुझे एक पेपर मिला है जिसमें ठीक उसी प्रक्रिया का वर्णन है जिसकी मुझे ज़रूरत है। अंतर केवल इतना है कि मासिक के साधनों को संरक्षित करते हुए कागज मासिक औसत डेटा को दैनिक रूप से प्रक्षेपित करता है। मुझे दृष्टिकोण को लागू करने में परेशानी है R। …

1
बड़ा नमूना स्पर्शोन्मुख / सिद्धांत - देखभाल करने के लिए क्यों?
मुझे उम्मीद है कि इस प्रश्न को "बहुत सामान्य" के रूप में चिह्नित नहीं किया गया है और आशा है कि एक चर्चा शुरू हो जाती है जो सभी को लाभ देती है। आंकड़ों में, हम बड़े नमूना सिद्धांतों को सीखने में बहुत समय बिताते हैं। हम अपने आकलनकर्ताओं की …

1
मिश्रित प्रभाव मॉडल पर भविष्यवाणी: यादृच्छिक प्रभावों के साथ क्या करना है?
आइए इस काल्पनिक डेटासेट पर विचार करें: set.seed(12345) num.subjects <- 10 dose <- rep(c(1,10,50,100), num.subjects) subject <- rep(1:num.subjects, each=4) group <- rep(1:2, each=num.subjects/2*4) response <- dose*dose/10 * group + rnorm(length(dose), 50, 30) df <- data.frame(dose=dose, response=response, subject=subject, group=group) हम lmeएक यादृच्छिक प्रभाव मॉडल के साथ प्रतिक्रिया को मॉडल करने के …

1
क्या मानक त्रुटियों और विश्वास अंतरालों को उन रजिस्टरों में उचित है जहां समलैंगिकता धारणा का उल्लंघन किया गया है?
यदि मानक OLS प्रतिगमन में दो मान्यताओं का उल्लंघन किया जाता है (त्रुटियों, समरूपता का सामान्य वितरण), तो मानक त्रुटियों को दूर करने के लिए मानक त्रुटियों पर विश्वास करने के लिए मानक त्रुटियों को बूटस्ट्रैप करना और आत्मविश्वास अंतराल एक उपयुक्त विकल्प है? क्या बूटस्ट्रैप्ड मानक त्रुटियों और आत्मविश्वास …

1
आकस्मिक तालिका में क्या है?
मरियम वेबस्टर शब्दकोश एक को परिभाषित करता है आकस्मिक घटना या स्थिति के रूप में 1 : likely but not certain to happen : possible 2 : not logically necessary; especially : empirical 3 a : happening by chance or unforeseen causes b : subject to chance or unseen effects …

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.