सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

3
मैं डेटा के यादृच्छिक नमूने से अद्वितीय घटना का अनुमान कैसे लगा सकता हूं?
मान लीजिए कि मेरे पास मानों का एक बड़ा समूह है जो कभी-कभी दोहराता है। मैं बड़े सेट में अद्वितीय मूल्यों की कुल संख्या का अनुमान लगाना चाहता हूं ।SSS यदि मैं मानों का यादृच्छिक नमूना लेता हूं , और यह निर्धारित करता कि इसमें अद्वितीय मान हैं, तो क्या …

2
फ्रीडमैन द्वारा "सांख्यिकी" के बीच चयन, और फ्रीडमैन द्वारा "सांख्यिकीय मॉडल: सिद्धांत और व्यवहार"
मैं एक सांख्यिकीविद् नहीं हूं, लेकिन मुझे आंकड़ों में बहुत दिलचस्पी है और मैं संदर्भ के रूप में रखने के लिए एक पुस्तक खरीदना चाहता हूं। मेरे पास विशिष्ट विषयों पर कुछ पुस्तकें हैं (जैसे कि मशीन लर्निंग के लिए सांख्यिकीय सीखने के तत्व या बायेसियन डेटा विश्लेषण ... के …
16 references 

4
P (A, B | C) / P (B | C) = P (A | B, C) क्यों है?
मैं समझता हूँ । सशर्त बी के पूरे क्षेत्र द्वारा विभाजित ए और बी का चौराहा है।P(A∩B)/P(B)=P(A|B)P(A∩B)/P(B)=P(A|B)P(A\cap B)/P(B) = P(A|B) लेकिन क्यों है?P(A∩B|C)/P(B|C)=P(A|B∩C)P(A∩B|C)/P(B|C)=P(A|B∩C)P(A\cap B|C)/P(B|C) = P(A|B \cap C) क्या आप कुछ अंतर्ज्ञान दे सकते हैं? यह नहीं होना चाहिए: ?P(A∩B∩C)/P(B,C)=P(A|B∩C)P(A∩B∩C)/P(B,C)=P(A|B∩C)P(A\cap B \cap C)/P(B,C) = P(A|B \cap C)

2
क्या यादृच्छिक वन को स्केल या केंद्रित करने के लिए इनपुट चर की आवश्यकता होती है?
मेरे इनपुट चर के विभिन्न आयाम हैं। कुछ चर दशमलव हैं जबकि कुछ सैकड़ों हैं। क्या यादृच्छिक वन का उपयोग करते समय डेटा को आयामहीन बनाने के लिए इन इनपुट चर को केंद्र (घटाना औसत) या स्केल (मानक विचलन द्वारा विभाजित) करना आवश्यक है?

2
लॉजिस्टिक रिग्रेशन के लिए मैट्रिक्स नोटेशन
रैखिक प्रतिगमन (चुकता नुकसान) में, मैट्रिक्स का उपयोग करके हमारे पास उद्देश्य के लिए एक बहुत संक्षिप्त संकेतन है minimize ∥Ax−b∥2minimize ‖Ax−b‖2\text{minimize}~~ \|Ax-b\|^2 जहाँ AAA डेटा मैट्रिक्स है, xxx गुणांक है, और bbb प्रतिक्रिया है। क्या लॉजिस्टिक रिग्रेशन उद्देश्य के लिए मैट्रिक्स नोटेशन समान है? मैंने जितने भी नोटिस देखे …

1
कनवल्शन नेटवर्क में कन्वेन्शन फिल्टर की संख्या का क्या महत्व है?
एक कनवल्शन लेयर में फिल्टर की संख्या क्या बताती है? यह संख्या वास्तुकला के प्रदर्शन या गुणवत्ता को कैसे प्रभावित करती है? मेरा मतलब है कि हमें हमेशा अधिक संख्या में फिल्टर का विकल्प चुनना चाहिए? उनमें से क्या अच्छा है? और लोग अलग-अलग परतों के लिए अलग-अलग फ़िल्टर कैसे …

2
यादृच्छिक जंगलों के लिए रिपोर्ट करने के लिए प्रशिक्षण त्रुटि का क्या उपाय है?
मैं वर्तमान randomForestमें आर में पैकेज का उपयोग करके एक वर्गीकरण समस्या के लिए यादृच्छिक जंगलों को फिट कर रहा हूं , और इन मॉडलों के लिए प्रशिक्षण त्रुटि की रिपोर्ट करने के तरीके के बारे में अनिश्चित हूं । मेरी प्रशिक्षण त्रुटि 0% के करीब है जब मैं इसे …

2
आत्मविश्वास अंतराल की व्याख्या
नोट: अग्रिम में माफी अगर यह एक डुप्लिकेट है, तो मुझे अपनी खोज में एक समान q नहीं मिला कहें कि हमारे पास एक सच्चा पैरामीटर है। एक आत्मविश्वास अंतराल सी (एक्स) एक आरवी है जिसमें पी शामिल है, 95% समय कहते हैं। अब मान लें कि हम X का …

3
गैर-नकारात्मक मैट्रिक्स कारक में अव्यक्त कारकों की एक इष्टतम संख्या कैसे चुनें?
एक मैट्रिक्स को देखते हुए Vm×nVm×n\mathbf V^{m \times n}, गैर-नकारात्मक मैट्रिक्स फैक्टराइजेशन (NMF) दो गैर-नकारात्मक मैट्रिक्स Wm×kWm×k\mathbf W^{m \times k} और Hk×nHk×n\mathbf H^{k \times n} (सभी तत्वों ≥0≥0\ge 0 ) को अपघटित मैट्रिक्स के रूप में दर्शाता है: V≈WH,V≈WH,\mathbf V \approx \mathbf W\mathbf H, कि गैर नकारात्मक की आवश्यकता द्वारा …

3
हम बोलचाल की भाषा कब बोल सकते हैं
रैखिक मॉडल में हमें यह जांचने की आवश्यकता है कि क्या व्याख्यात्मक चर के बीच एक संबंध मौजूद है। यदि वे बहुत अधिक सहसंबंधित होते हैं तो कोलिनैरिटी (यानी, चर एक दूसरे को आंशिक रूप से समझाते हैं)। मैं वर्तमान में केवल व्याख्यात्मक चर के बीच युग्म के सहसंबंध को …

3
नेस्टेड var-covar मॉडल में से किसी एक को चुनने के लिए REML (ML के बजाय) का उपयोग क्यों करना पड़ता है?
रैखिक मिश्रित मॉडल के यादृच्छिक प्रभावों पर मॉडल चयन पर विभिन्न विवरण REML का उपयोग करने का निर्देश देते हैं। मैं कुछ स्तर पर REML और ML के बीच अंतर जानता हूं, लेकिन मुझे समझ नहीं आता कि REML का उपयोग क्यों किया जाना चाहिए क्योंकि ML पक्षपाती है। उदाहरण …

1
शुद्धता की गणना कैसे करें?
क्लस्टर विश्लेषण में हम शुद्धता की गणना कैसे करते हैं? क्या है समीकरण? मैं यह करने के लिए एक कोड की तलाश नहीं कर रहा हूं। चलो ωkωk\omega_k क्लस्टर कश्मीर, और हो cjcjc_j हो वर्ग जे। तो शुद्धता व्यावहारिक रूप से सटीकता है? ऐसा लगता है कि नमूना आकार पर …
16 clustering 


1
एक रेखीय प्रतिगमन के लिए अंकों की न्यूनतम संख्या
एक रेखीय प्रतिगमन के साथ समय के साथ एक प्रवृत्ति को देखने के लिए "उचित" न्यूनतम संख्या क्या होगी? क्या एक द्विघात मॉडल फिटिंग के बारे में? मैं स्वास्थ्य (एसआईआई, आरआईआई) में असमानता के समग्र सूचकांकों के साथ काम करता हूं, और सर्वेक्षण की केवल 4 तरंगें हैं, इसलिए 4 …
16 regression 

2
दो सहसंबद्ध यादृच्छिक चर के नमूने के लिए कुछ तकनीकें क्या हैं?
दो सहसंबद्ध यादृच्छिक चर के नमूने के लिए कुछ तकनीकें क्या हैं: यदि उनकी संभाव्यता वितरण को मानकीकृत किया जाता है (जैसे, लॉग-सामान्य) यदि उनके पास गैर-पैरामीट्रिक वितरण है। डेटा दो समय श्रृंखला है जिसके लिए हम गैर-शून्य सहसंबंध गुणांक की गणना कर सकते हैं। हम भविष्य में इन आंकड़ों …

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.