सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

2
आनुवंशिक प्रोग्रामिंग के लिए किस भाषा का उपयोग करना है
एक असाइनमेंट के हिस्से के रूप में मुझे एक आनुवंशिक प्रोग्रामिंग एल्गोरिदम लिखना होगा जो वायुमंडलीय प्रदूषक स्तरों की भविष्यवाणी करता है। चूंकि मेरे पास कोई अनुभव नहीं है, क्या कोई मुझे प्रोग्रामिंग भाषाओं के प्रस्तावों की ओर संकेत कर सकता है जिसमें विकसित कार्यक्रम लिखे जाएंगे । स्पष्टता: मैं …

2
LASSO / LARS बनाम सामान्य से विशिष्ट (GETS) विधि
मैं सोच रहा था, क्यों LASSO और LARS मॉडल चयन के तरीके इतने लोकप्रिय हैं, भले ही वे मूल रूप से सौतेले वार फॉरवर्ड सिलेक्शन के भिन्नरूप हैं (और इस तरह पथ निर्भरता से पीड़ित हैं)? इसी तरह, मॉडल चयन के लिए जनरल टू स्पेसिफिक (GETS) के तरीकों को ज्यादातर …

4
लंबा वसा डेटा के साथ वर्गीकरण
मुझे अपने लैपटॉप पर सैकड़ों हजारों डेटा बिंदुओं और लगभग दस हजार विशेषताओं के साथ एक रैखिक क्लासिफायरफ़ायर प्रशिक्षित करने की आवश्यकता है। मेरे विकल्प क्या हैं? इस प्रकार की समस्या के लिए कला की स्थिति क्या है? ऐसा लगता है कि स्टोकेस्टिक ग्रेडिएंट डिसेंट होनहार दिशा है, और मेरी …

2
बड़े डेटा सेट के लिए महत्व स्तर का चयन कैसे करें?
मैं एक डेटा सेट के साथ काम कर रहा हूं जिसमें 200,000 के आसपास एन है। प्रतिगमन में, मैं बहुत छोटे महत्व मान देख रहा हूं << 0.001 बहुत छोटे प्रभाव आकारों से जुड़ा हुआ है, उदाहरण के लिए r = 0.028। जो मैं जानना चाहता हूं, क्या नमूना आकार …

2
कॉक्स आनुपातिक खतरों के मॉडल के साथ क्रॉस-सत्यापन कैसे करें?
मान लीजिए मैंने एक डेटासेट (मॉडल बिल्डिंग डेटासेट) में किसी विशेष बीमारी की घटना के लिए एक भविष्यवाणी मॉडल का निर्माण किया है और अब यह जांचना चाहता हूं कि मॉडल एक नए डेटासेट (सत्यापन डेटासेट) में कितनी अच्छी तरह काम करता है। लॉजिस्टिक रिग्रेशन के साथ बनाए गए मॉडल …

2
R: पार्टी बनाम रप्टर में विभाजन वाले पेड़
पेड़ों को बांटते हुए मुझे कुछ समय हो गया है। पिछली बार मैंने इस तरह की बात की थी, मुझे आर (होथोर्न द्वारा बनाई गई) में पार्टी पसंद है। नमूना के माध्यम से सशर्त निष्कर्ष का विचार मेरे लिए समझ में आता है। लेकिन समकक्षों की भी अपील थी। वर्तमान …
15 r  cart  rpart  partitioning 

1
निरंतर चर की भविष्यवाणी करते समय निर्णय वृक्ष विभाजन को कैसे लागू किया जाना चाहिए?
मैं वास्तव में रैंडम फ़ॉरेस्ट का कार्यान्वयन लिख रहा हूं, लेकिन मेरा मानना ​​है कि प्रश्न पेड़ों (आरएफ से स्वतंत्र) के लिए विशिष्ट है। इसलिए संदर्भ यह है कि मैं एक निर्णय वृक्ष में एक नोड बना रहा हूं और भविष्यवाणी और लक्ष्य चर दोनों निरंतर हैं। नोड के पास …

3
कंप्यूटर लैब में R सिखाने के लिए एक अच्छा तरीका क्या है?
वहाँ कई अच्छे सवाल और परिचयात्मक पुस्तकों पर जवाब के सेट किया गया या आर जैसे सीखने दृष्टिकोण है यहाँ और यहाँ । लेकिन मुझे थोड़ी अलग समस्या है - एक कंप्यूटर लैब में एक घंटे लंबे सत्र (या कई ऐसे सत्र) चलाने का सबसे अच्छा तरीका जो लोगों को …
15 r  teaching 

2
सामान्य मशीन लर्निंग एल्गोरिदम का रन-टाइम विश्लेषण
क्या किसी के पास सामान्य मशीन लर्निंग एल्गोरिदम (एनएन, एसवीएम, आदि के विभिन्न जायके) के लिए रन-टाइम विश्लेषण का सारांश है?

3
जीएमएम का उपयोग करने पर कब विचार करना चाहिए?
जो चीजें अर्थमिति को विशिष्ट बनाती हैं उनमें से एक है सामान्यीकृत विधि का क्षण तकनीक का उपयोग। जीएमएम किस प्रकार की समस्याओं को अन्य अनुमान तकनीकों की तुलना में अधिक उपयुक्त बनाता है? GMM का उपयोग आपको दक्षता या कम किए गए पूर्वाग्रह या अधिक विशिष्ट पैरामीटर आकलन के …

1
आयाम बढ़ने पर सामान्य वितरण की घनत्व
जो प्रश्न मैं पूछना चाहता हूं वह यह है कि 1 सामान्य वितरण के दौरान एसडी के नमूनों का अनुपात भिन्न-भिन्न कैसे होता है क्योंकि वेरिएबल की संख्या बढ़ जाती है? (लगभग) हर कोई जानता है कि 1 आयामी सामान्य वितरण में, मीन के 1 मानक विचलन के भीतर 68% …

4
यदि किसी चर का मानक विचलन 0 है तो सहसंबंध क्या है?
जैसा कि मैं समझता हूं, हम समीकरण का उपयोग करके सहसंयोजक को सामान्य करके सहसंबंध प्राप्त कर सकते हैं ρi,j=cov(Xi,Xj)σiσjρi,j=cov(Xi,Xj)σiσj\rho_{i,j}=\frac{cov(X_i, X_j)}{\sigma_i \sigma_j} जहां Xiका मानक विचलन है।σi=E[(Xi−μi)2]−−−−−−−−−−−√σi=E[(Xi−μi)2]\sigma_i=\sqrt{E[(X_i-\mu_i)^2]}XiXiX_i मेरी चिंता यह है कि क्या मानक विचलन शून्य के बराबर है? क्या ऐसी कोई शर्त है जो गारंटी देती है कि यह …

2
सुविधाओं की संख्या बढ़ने से सटीकता में गिरावट आती है लेकिन पूर्व / स्मरण में वृद्धि होती है
मैं मशीन लर्निंग के लिए नया हूं। फिलहाल मैं एनएलटीके और अजगर का उपयोग करके 3 वर्गों में छोटे ग्रंथों को सकारात्मक, नकारात्मक या तटस्थ के रूप में वर्गीकृत करने के लिए एक नैवे बे (एनबी) क्लासिफायर का उपयोग कर रहा हूं। कुछ परीक्षणों का आयोजन करने के बाद, 300,000 …

6
"नीति" परिवर्तन के कारण समय श्रृंखला डेटा में एक महत्वपूर्ण परिवर्तन का पता कैसे लगाया जाए?
मुझे उम्मीद है कि यह पोस्ट करने के लिए यह सही जगह है, मैंने इसे संदेह पर पोस्ट करने पर विचार किया था, लेकिन मुझे लगता है कि वे सिर्फ यह कहेंगे कि अध्ययन सांख्यिकीय रूप से गलत था। मैं प्रश्न के फ्लिप पक्ष के बारे में उत्सुक हूं कि …

9
क्या गैर-नकारात्मक डेटा का मानक विचलन औसत से अधिक हो सकता है?
मेरे पास कुछ त्रिकोणीय 3D मेष हैं। त्रिकोण क्षेत्रों के आँकड़े हैं: न्यूनतम 0.000 अधिकतम 2341.141 मीन 56.317 Std dev 98.720 तो, क्या इसका मतलब मानक विचलन के बारे में विशेष रूप से उपयोगी है या सुझाव है कि इसकी गणना करने में कीड़े हैं, जब आंकड़े ऊपर की तरह …

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.