सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

2
आक्षेप के लिए ARIMA त्रुटियों के साथ प्रतिगमन का उपयोग करने की स्थिर आवश्यकताएं क्या हैं?
अनुमान के लिए ARIMA त्रुटियों (डायनेमिक प्रतिगमन) के साथ प्रतिगमन का उपयोग करने की स्थिर आवश्यकताएं क्या हैं? विशेष रूप से, मेरे पास एक गैर-स्थिर निरंतर परिणाम चर , एक गैर-स्थिर निरंतर भविष्य कहनेवाला चर x a और एक डमी चर उपचार श्रृंखला x b । मैं यह जानना चाहूंगा …

3
ऑनलाइन और बैच लर्निंग में क्या अंतर है?
मैं वर्तमान में फॉरवर्ड-बैकवर्ड स्प्लिटिंग का उपयोग करके पेपर ऑनलाइन कुशल और बैच लर्निंग पढ़ता हूं जॉन ड्यूची और योरम सिंगर द्वारा । मैं 'ऑनलाइन' और 'बैच' शब्दों के उपयोग को लेकर बहुत उलझन में हूं। मैंने सोचा था कि 'ऑनलाइन' का मतलब है कि हम प्रशिक्षण डेटा की एक …

4
नौसिखियों के लिए सामान्यीकृत रैखिक मॉडल के बारे में सबसे अच्छी पुस्तक क्या है?
मैं अभी भी सामान्यीकृत रेखीय मॉडल के लिए बहुत नया हूं, और मैंने जिन जीएलएम ग्रंथों को उठाया है उनमें से अधिकांश में मैं बहुत सारे अंकन के साथ संघर्ष करता हूं। क्या बेहद लोकप्रिय जीएलएम किताबें हैं जो खुद को पठनीयता के लिए बेहतर बताती हैं?

2
सही अनुकूलन एल्गोरिदम कैसे चुनें?
मुझे एक फ़ंक्शन का न्यूनतम पता लगाने की आवश्यकता है। Http://docs.scipy.org/doc/scipy/reference/optimize.html पर डॉक्स पढ़ने से मुझे लगता है कि कई एल्गोरिदम हैं जो एक ही काम करते हैं, यानी न्यूनतम पाते हैं। मुझे कैसे पता चलेगा कि मुझे कौन सा चुनना चाहिए? कुछ एल्गोरिथ्म सूचीबद्ध हैं डाउनहिल सिम्प्लेक्स एल्गोरिथ्म का …

3
क्या एक बहु-परिवर्तनीय प्रतिगमन में अधिक चर जोड़ने से मौजूदा चर के गुणांक बदल जाते हैं?
मान लें कि मेरे पास एक बहुक्रियाशील (कई स्वतंत्र चर) प्रतिगमन हैं जिनमें 3 चर हैं। उन चर में से प्रत्येक में एक दिया गुणांक है। अगर मैं 4 वें चर को लागू करने और प्रतिगमन को फिर से शुरू करने का फैसला करता हूं, तो क्या 3 मूल चर …

1
क्या मैं चर के लिए एक सहसंयोजक मैट्रिक्स को अनिश्चितताओं में बदल सकता हूं?
मैं एक जीपीएस यूनिट है कि एक शोर आउटपुट माप के माध्यम से सहप्रसरण मैट्रिक्स है :ΣΣ\Sigma Σ=⎡⎣⎢σxxσyxσxzσxyσyyσyzσxzσyzσzz⎤⎦⎥Σ=[σxxσxyσxzσyxσyyσyzσxzσyzσzz]\Sigma = \left[\begin{matrix} \sigma_{xx} & \sigma_{xy} & \sigma_{xz} \\ \sigma_{yx} & \sigma_{yy} & \sigma_{yz} \\ \sigma_{xz} & \sigma_{yz} & \sigma_{zz} \end{matrix}\right] (इसमें भी शामिल है लेकिन आइए इसे अनदेखा करें जो एक सेकंड …

5
नमूने का नमूना वितरण का मतलब जनसंख्या का अनुमानित मतलब कैसे है?
मैं आँकड़ों को सीखने की कोशिश कर रहा हूँ क्योंकि मुझे लगता है कि यह इतना प्रचलित है कि यह मुझे कुछ चीजें सीखने से रोकता है अगर मैं इसे ठीक से नहीं समझता। नमूना साधनों के नमूने वितरण की इस धारणा को समझने में मुझे परेशानी हो रही है। …

3
लापता मूल्यों और / या अनियमित समय श्रृंखला के साथ आर फोरकास्ट पैकेज का उपयोग करना
मैं आर forecastपैकेज से प्रभावित हूं , साथ ही zooअनियमित समय श्रृंखला के लिए पैकेज और लापता मूल्यों के प्रक्षेप। मेरा आवेदन कॉल सेंटर ट्रैफ़िक पूर्वानुमान के क्षेत्र में है, इसलिए सप्ताहांत पर डेटा (लगभग) हमेशा गायब रहता है, जिसे अच्छी तरह से निपटाया जा सकता है zoo। इसके अलावा, …

2
पीसीए और के-गुना क्रॉस-वैलिडेशन इन कैरट पैकेज आर
मैं सिर्फ कर्सरा पर मशीन लर्निंग कोर्स के एक व्याख्यान को फिर से देखता हूं। जिस अनुभाग में प्रोफेसर पर्यवेक्षित शिक्षण अनुप्रयोगों में पूर्व-प्रसंस्करण डेटा के लिए पीसीए पर चर्चा करते हैं, उनका कहना है कि पीसीए को केवल प्रशिक्षण डेटा पर ही किया जाना चाहिए और फिर क्रॉस सत्यापन …

2
जब कोई कहता है कि एक पोइसन मॉडल के लिए अवशिष्ट अवतरण / df ~ 1 होना चाहिए, तो लगभग कैसे अनुमानित है?
मैंने अक्सर यह जांचने की सलाह देखी है कि पॉसन मॉडल फिट है या नहीं, यह स्वतंत्रता की डिग्री द्वारा अवशिष्ट अवशिष्ट को विभाजित करने से जुड़ा हुआ है। परिणामी अनुपात "लगभग 1" होना चाहिए। सवाल यह है कि हम "अनुमानित" के लिए किस सीमा के बारे में बात कर …

5
समग्र प्रणाली सटीकता पर प्रशिक्षण डेटा बढ़ने से क्या प्रभाव पड़ता है?
क्या कोई मेरे लिए संभावित उदाहरणों के साथ संक्षेप में बता सकता है कि प्रशिक्षण के आंकड़ों को बढ़ाने से किन स्थितियों में समग्र प्रणाली में सुधार होता है? जब हम यह पता लगाते हैं कि अधिक प्रशिक्षण डेटा जोड़ना संभवतः डेटा को अधिक फिट कर सकता है और परीक्षण …

2
IID नमूने के लिए परीक्षण करें
आप कैसे परीक्षण करेंगे या जाँचेंगे कि नमूना IID (स्वतंत्र और समान रूप से वितरित) है? ध्यान दें कि मेरा मतलब गौसियन और आइडेंटिटीली डिस्ट्रिब्यूटेड नहीं है, सिर्फ IID है। और यह विचार मेरे दिमाग में आता है कि नमूना को समान आकार के दो उप-नमूनों में बार-बार विभाजित करना …

3
क्या फॉर्मूला या विश्लेषण के डेटा का अनुकरण करने के लिए एक सामान्य तरीका उपलब्ध है?
एक प्रयोगात्मक डिजाइन डेटा फ्रेम से डेटा का डे नोवो सिमुलेशन। आर पर ध्यान देने के साथ (हालांकि अन्य भाषा समाधान महान होगा)। एक प्रयोग या सर्वेक्षण तैयार करने में, डेटा का अनुकरण और इस सिम्युलेटेड डेटा पर एक विश्लेषण का आयोजन डिजाइन के फायदे और कमजोरियों के बारे में …

3
आप बिना किसी सांख्यिकीय पृष्ठभूमि वाले लोगों को सामान्यीकृत रैखिक मॉडल कैसे समझाएंगे?
मेरे पास हमेशा एक कठिन समय होता है, जिसमें सांख्यिकीय तकनीकों की व्याख्या की जाती है, जिसमें कोई सांख्यिकीय पृष्ठभूमि नहीं होती है। अगर मैं यह बताना चाहता हूं कि ऐसे दर्शकों के लिए GLM क्या है (सांख्यिकीय शब्दजाल को हटाए बिना), तो सबसे अच्छा या प्रभावी तरीका क्या होगा? …

2
वितरण का उपयोग आमतौर पर मॉडल प्रतिक्रिया समय के लिए किस चीज के लिए किया जाता है?
मेरे पास एक सर्वलेट-आधारित अनुप्रयोग है, जिसमें मैं उस सर्वलेट के लिए प्रत्येक अनुरोध को पूरा करने में लगने वाले समय को मापता हूं। मैं पहले से ही औसत और अधिकतम जैसे सरल आंकड़ों की गणना करता हूं; मैं हालांकि कुछ अधिक परिष्कृत विश्लेषण का उत्पादन करना चाहूंगा, और ऐसा …

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.