सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

3
फिटिंग बहुभिन्नरूपी, प्राकृतिक घन पट्टी
नोट: एक महीने के बाद कोई सही उत्तर नहीं होने पर, मैंने एसओ को रिपॉजिट किया पृष्ठभूमि मेरे पास एक मॉडल है, , जहां वाई = एफ ( एक्स )चचfY= च( एक्स )Y=च(एक्स)Y=f(\textbf{X}) एक है n × मीटर से नमूनों की मैट्रिक्स मीटर मापदंडों और Y है n × 1 …

2
95 वें प्रतिशत की गणना: सामान्य वितरण, आर क्वांटाइल और एक्सेल दृष्टिकोण की तुलना करना
मैं निम्नलिखित डेटासेट पर 95 वीं प्रतिशतक की गणना करने की कोशिश कर रहा था। मैं इसे करने के कुछ ऑनलाइन संदर्भों में आया था। दृष्टिकोण 1: नमूना डेटा के आधार पर पहले एक मुझसे कहता है प्राप्त करने के लिए TOP 95 Percentडेटासेट के और फिर चुनें MINया AVGपरिणामी …
17 r  dataset  quantiles  sql 

5
आर में यादृच्छिक जंगलों के साथ वर्गीकरण के लिए, असंतुलित वर्ग आकारों के लिए कैसे समायोजित किया जाना चाहिए?
मैं जिस परियोजना पर काम कर रहा हूं, उसके लिए विभिन्न वर्गीकरण विधियों की खोज कर रहा हूं, और रैंडम वन की कोशिश करने में दिलचस्पी रखता हूं। मैं अपने आप को शिक्षित करने की कोशिश कर रहा हूं जैसे मैं साथ जाता हूं, और सीवी समुदाय द्वारा प्रदान की …

7
क्या सरल रेखीय प्रतिगमन सामान्य कारण है?
मैं जानता हूं कि सहसंबंध का अर्थ कार्य-कारण नहीं है, बल्कि संबंध की मजबूती और दिशा है। क्या सरल रेखीय प्रतिगमन सामान्य कारण है? या इसके लिए एक अनुमान (टी-टेस्ट, आदि) सांख्यिकीय परीक्षण आवश्यक है?

2
कॉक्स रिग्रेशन में एक्स (बी) की व्याख्या कैसे करूं?
मैं आंकड़ों को समझने की कोशिश कर रहा एक मेडिकल छात्र हूँ (!) - तो कृपया कोमल रहें! ;) मैं अस्तित्व विश्लेषण (कपलान-मीयर, लॉग-रैंक और कॉक्स प्रतिगमन) सहित सांख्यिकीय विश्लेषण की एक उचित मात्रा में एक निबंध लिख रहा हूं। मैंने अपने डेटा पर कॉक्स रिग्रेशन चलाया ताकि यह पता …

5
रैखिक प्रतिगमन मॉडल में आवधिक घटक कैसे जोड़ें?
मेरे पास कुछ संचयी आवृत्ति डेटा है। एक लाइन y=ax+by=ax+by=ax+b ऐसा लगता है कि यह डेटा को बहुत अच्छी तरह से फिट करता है, लेकिन लाइन में चक्रीय / आवधिक झटके हैं। मैं अनुमान लगाना चाहूंगा कि जब संचयी आवृत्ति एक निश्चित मूल्य तक पहुंच जाएगी ccc । जब मैं …

1
मात्रात्मक वित्त में एचएमएम का उपयोग। HMM के उदाहरण जो ट्रेंड / टर्निंग पॉइंट का पता लगाने का काम करते हैं?
मैं ऐसे "हिडन मार्कोव मॉडल" की अद्भुत दुनिया की खोज कर रहा हूं, जिसे "शासन स्विचिंग मॉडल" भी कहा जाता है। मैं रुझानों और मोड़ का पता लगाने के लिए आर में एक एचएमएम को अनुकूलित करना चाहूंगा। मैं मॉडल को यथासंभव सामान्य बनाना चाहता हूं ताकि मैं कई कीमतों …

4
उत्तरजीविता विश्लेषण में हेज़र्ड अनुपात की गणना के लिए लोगानक बनाम मेंटल-हेंसेल विधि का उपयोग करने के पेशेवरों और विपक्ष क्या हैं?
दो उत्तरजीविता वक्रों की तुलना को संक्षेप में प्रस्तुत करने का एक तरीका खतरनाक अनुपात (एचआर) की गणना करना है। इस मान की गणना करने के लिए (कम से कम) दो तरीके हैं। लोगानक विधि। कापलान-मायर गणना के रूप में, प्रत्येक समूह में मनाया घटनाओं (मौतें, आमतौर पर) की संख्या …
17 survival  hazard 

2
रैखिक प्रतिगमन के लिए टी-टेस्ट को समझना
मैं एक लीनियर रिग्रेशन पर कुछ परिकल्पना परीक्षण करने के लिए काम करने की कोशिश कर रहा हूं (अशक्त परिकल्पना कोई संबंध नहीं है)। मैं जिस विषय पर चलता हूं, उस पर हर गाइड और पेज टी-टेस्ट का उपयोग करता हुआ प्रतीत होता है। लेकिन मुझे समझ में नहीं आता …

1
अनइनफॉर्मेटिव बीटा पादरियों के बीच चयन
मैं एक द्विपद प्रक्रिया (हिट / मिस) के साथ काम करने के लिए बीटा वितरण के लिए बिना सूचना के पुजारियों की तलाश कर रहा हूं। पहले मैं पर उपयोग करने के बारे में सोचा या जेफरी पहले कि एक वर्दी पीडीएफ उत्पन्न, α = 0.5 , β = 0.5 …

2
एक लीनियर रिग्रेशन गुणांक की परिकल्पना के परीक्षण के लिए एक टी वितरण का उपयोग क्यों किया जाता है?
व्यवहार में, एक रेखीय प्रतिगमन गुणांक के महत्व की जांच करने के लिए एक मानक टी-परीक्षण का उपयोग करना आम बात है। गणना के यांत्रिकी मुझे समझ में आते हैं। ऐसा क्यों है कि टी-वितरण का उपयोग रैखिक प्रतिगमन परिकल्पना परीक्षण में उपयोग किए जाने वाले मानक परीक्षण सांख्यिकीय को …

2
जब फीचर्स के सहसंबद्ध होने पर लासो या इलास्टिकनेट रिज से बेहतर प्रदर्शन करते हैं
मेरे पास 150 विशेषताओं का एक सेट है, और उनमें से कई एक-दूसरे के साथ अत्यधिक सहसंबद्ध हैं। मेरा लक्ष्य एक असतत चर के मूल्य का अनुमान लगाना है, जिसकी सीमा 1-8 है । मेरे नमूने का आकार 550 है , और मैं 10-गुना क्रॉस-सत्यापन का उपयोग कर रहा हूं …

4
क्लस्टरिंग विधियों को क्लस्टर की संख्या को पूर्व-निर्दिष्ट करने की आवश्यकता नहीं है
क्या कोई "गैर-पैरामीट्रिक" क्लस्टरिंग विधियां हैं जिनके लिए हमें क्लस्टर की संख्या निर्दिष्ट करने की आवश्यकता नहीं है? और अन्य पैरामीटर जैसे अंक प्रति क्लस्टर, आदि।
17 clustering 

3
नए डेटा के साथ बायेसियन अपडेट
N डेटा बिंदुओं के अवलोकन के बाद हम पूर्व N (a, b) के साथ एक पश्च की गणना के बारे में कैसे जाना है? मुझे लगता है कि हमें डेटा बिंदुओं के नमूना माध्य और विचरण की गणना करनी है और कुछ प्रकार की गणना करना है जो कि पूर्व …

5
सहसंयोजक मैट्रिक्स से "विचरण" का एक उपाय?
यदि डेटा 1d है, तो विचरण यह दर्शाता है कि डेटा बिंदु एक दूसरे से किस हद तक भिन्न हैं। यदि डेटा बहुआयामी है, तो हमें एक सहसंयोजक मैट्रिक्स मिलेगा। क्या कोई उपाय है जो एक ही नंबर देता है कि बहु-आयामी डेटा के लिए सामान्य रूप से डेटा बिंदु …

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.