सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

2
सुविधाओं की संख्या बढ़ने से प्रदर्शन कम क्यों हो जाता है?
मैं एक अंतर्ज्ञान हासिल करने की कोशिश कर रहा हूं कि क्यों सुविधाओं की संख्या बढ़ने से प्रदर्शन कम हो सकता है। मैं वर्तमान में एक एलडीए क्लासिफायर का उपयोग कर रहा हूं, जो कुछ विशेषताओं के बीच बेहतर रूप से बेहतर प्रदर्शन करता है, लेकिन अधिक सुविधाओं को देखते …

1
गणना डेटा का वर्णन करना
मैंने ट्रेंड, मौसमी और अनियमित घटकों में गणना डेटा को विघटित करने के लिए R में stl () का उपयोग किया। परिणामी प्रवृत्ति मान अब पूर्णांक नहीं हैं। मेरे पास निम्नलिखित प्रश्न हैं: क्या stl () डेटा की गणना करने के लिए एक उपयुक्त तरीका है? चूंकि परिणामी प्रवृत्ति अब …

1
आर का उपयोग करके "व्हाइट हाउस के पथ" की गणना कैसे करें?
मैं अभी इस महान विश्लेषण में आया हूं जो कि दिलचस्प और सुंदर दोनों है: http://www.nytimes.com/interactive/2012/11/02/us/politics/paths-to-the-white-house.html मैं उत्सुक हूं कि आर का उपयोग करके इस तरह के "पथ के पेड़" का निर्माण कैसे किया जा सकता है। ऐसे पथ पेड़ के निर्माण के लिए क्या डेटा और एल्गोरिदम की आवश्यकता …

1
क्या मैं एक मोड़ के संकेत के रूप में लॉजिस्टिक प्रतिगमन में एक द्विघात शब्द को शामिल करने की व्याख्या कर सकता हूं?
केवल रैखिक और द्विघात शब्दों के साथ एक लॉजिस्टिक रिग्रेशन में, अगर मेरे पास एक रैखिक गुणांक और द्विघात गुणांक , तो क्या मैं कह सकता हूं कि इसमें संभावना का मोड़ है ?β1β1\beta_1β2β2\beta_2−β1/(2β2)−β1/(2β2)-\beta_1 / (2\beta_2)

1
गैर-नेस्टेड मॉडल के लिए एआईसी: निरंतर को सामान्य बनाना
AIC को रूप में परिभाषित किया गया है , जहां अधिकतम संभावना अनुमानक है और पैरामीटर स्थान का आयाम है। के आकलन के लिए , एक आमतौर पर घनत्व के स्थिर कारक की उपेक्षा करता है। यह वह कारक है, जो संभावना को सरल बनाने के लिए, मापदंडों पर निर्भर …

6
कौन सी मशीन लर्निंग एल्गोरिदम यह अनुमान लगाने के लिए अच्छा है कि कौन सी सुविधाएँ अधिक महत्वपूर्ण हैं?
मेरे पास न्यूनतम सुविधाओं के साथ डेटा है जो नहीं बदलते हैं, और कुछ अतिरिक्त सुविधाएँ जो बदल सकती हैं और परिणाम पर बड़ा प्रभाव डालती हैं। मेरा डेटा-सेट इस तरह दिखता है: विशेषताएं ए, बी, सी (हमेशा मौजूद), और डी, ई, एफ, जी, एच (कभी-कभी मौजूद) हैं A = …

2
रैंडम फ़ॉरेस्ट: क्या होगा अगर मुझे पता है कि एक चर महत्वपूर्ण है
मेरी समझ में प्रत्येक निर्णय वृक्ष के निर्माण के लिए रैंडम फ़ॉरेस्ट बेतरतीब ढंग से mtry वैरिएबल है। इसलिए यदि mtry = ncol / 3 हो तो पेड़ों के 1/3 भाग में औसतन प्रत्येक चर का उपयोग किया जाएगा। और 2/3 पेड़ उनका उपयोग नहीं करेंगे। लेकिन क्या होगा अगर …

6
विविधता का एक मजबूत (गैर-पैरामीट्रिक) उपाय गुणांक की तरह - IQR / मंझला, या वैकल्पिक?
डेटा के दिए गए सेट के लिए, प्रसार को अक्सर मानक विचलन के रूप में या IQR (अंतर-चतुर्थक श्रेणी) के रूप में गणना की जाती है। जबकि एक standard deviationसामान्यीकृत (z- स्कोर, आदि) है और इसलिए इसका उपयोग दो अलग-अलग आबादी से प्रसार की तुलना करने के लिए किया जा …

2
एक परिमित गाऊसी मिश्रण और एक गाऊसी के बीच की दूरी क्या है?
मान लीजिए कि मेरे पास ज्ञात वजन, साधन और मानक विचलन के साथ बारीक से कई गौसियों का मिश्रण है। साधन नहीं के बराबर हैं। मिश्रण के औसत और मानक विचलन की गणना की जा सकती है, निश्चित रूप से, चूंकि घटकों के क्षणों का भार औसत होता है। मिश्रण …

4
क्या लॉजिस्टिक रिग्रेशन की अनुमानित संभावना वर्गीकरण में विश्वास के रूप में व्याख्या की जा सकती है
क्या हम किसी क्लासिफायर से प्राप्त पूर्ववर्ती संभावना की व्याख्या कर सकते हैं जो एक अनुमानित वर्ग मान और संभाव्यता (उदाहरण के लिए, लॉजिस्टिक रिग्रेशन या नैवे बेस) को किसी प्रकार के विश्वास स्कोर के रूप में प्रस्तुत करता है जो उस अनुमानित वर्ग मूल्य को सौंपा गया है?

3
क्या कोलमोगोरोव-स्मिर्नोव टेस्ट के लिए कई-नमूना संस्करण या विकल्प है?
मैं छह जोड़ी भूखंडों में पेड़ों के आकार के वितरण की तुलना कर रहा हूं जहां एक भूखंड को एक उपचार मिला और दूसरे को नियंत्रण। भूखंडों की प्रत्येक जोड़ी पर एक Kolmogorov-स्मिर्नोव परीक्षण का उपयोग करते हुए मुझे लगता है कि लगता है से लेकर करने के लिए । …

3
विसंगति का पता लगाने के लिए लापता मूल्यों के साथ समय श्रृंखला पर एसटीएल
मैं कुछ लापता टिप्पणियों के साथ जलवायु डेटा की समय श्रृंखला में विषम मूल्यों का पता लगाने की कोशिश कर रहा हूं। वेब पर खोज करने पर मुझे कई उपलब्ध दृष्टिकोण मिले। उनमें से, स्टाल अपघटन प्रवृत्ति और मौसमी घटकों को हटाने और शेष का अध्ययन करने के अर्थ में …

2
बिनर्ड डेटा की तीसरी चतुर्थांश का अनुमान कैसे लगाया जाए?
क्या तीसरा चतुर्थक निर्धारित करने के लिए कोई तकनीकी चाल है यदि यह एक खुले अंतराल से संबंधित है जिसमें एक चौथाई आबादी है (इसलिए मैं अंतराल को बंद नहीं कर सकता और मानक सूत्र का उपयोग नहीं कर सकता)? संपादित करें मामले में मैं कुछ गलत समझा मैं कम …

1
अलग-अलग परिणाम देने वाले विरल डेटा के आधार पर एक सहसंयोजक मैट्रिक्स के eigen और svd डिकम्पोज़िशन क्यों होते हैं?
मैं एक विरल / गैपी डेटा सेट के आधार पर एक सहसंयोजक मैट्रिक्स को विघटित करने की कोशिश कर रहा हूं। मैं देख रहा हूँ कि लैम्ब्डा (समझाया गया विचरण) का योग, जैसा कि गणना svdकी जा रही है, तेजी से गप्पी डेटा के साथ प्रवर्धित किया जा रहा है। …
12 r  svd  eigenvalues 

4
पीसीए मॉडल चयन AIC (या BIC) का उपयोग कर
मैं पीसीए निकालने के लिए उचित संख्या में कारकों का चयन करने के लिए एकैके सूचना मानदंड (एआईसी) का उपयोग करना चाहता हूं। एकमात्र मुद्दा यह है कि मुझे यकीन नहीं है कि मापदंडों की संख्या कैसे निर्धारित की जाए। मैट्रिक्स पर विचार करें , जहाँ , चर की संख्या …

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.