सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

2
क्या वुल्फराम मैथवर्ल्ड एक असत्यता संभावना वितरण के साथ असतत संभावना वितरण का वर्णन करने में गलती करता है?
आमतौर पर असतत चर पर एक प्रायिकता वितरण को प्रायिकता द्रव्यमान फ़ंक्शन (PMF) का उपयोग करके वर्णित किया जाता है: निरंतर यादृच्छिक चर के साथ काम करते समय, हम संभाव्यता घनत्व फ़ंक्शन (पीडीएफ) का उपयोग करके प्रायिकता वितरण का वर्णन करते हैं, बजाय एक संभाव्यता द्रव्यमान फ़ंक्शन के। - गुडफेलो, …

1
किसी दिए गए डेटा सेट में सबसे बड़े और सबसे छोटे मूल्यों के औसत का नाम क्या है?
आप ऐसे सांख्यिकीय साधन को क्या कहते हैं जो किसी भी डाटासेट में ऊपरी और निचले छोरों से गणना की जाती है? उदाहरण के लिए, यदि आपके पास एक सेट है: { -2, 0 , 8, 9, 1, 50, -2, 6} इस सेट का ऊपरी चरम 50और निचला चरम है …

3
दो आवृत्ति वितरण के बीच सांख्यिकीय "दूरी" को कैसे मापें?
मैं एक डेटा विश्लेषण परियोजना शुरू कर रहा हूं जिसमें वर्ष के दौरान वेबसाइट के उपयोग के समय की जांच करना शामिल है। मैं जो करना चाहता हूं, वह तुलना करता है कि उपयोग पैटर्न "संगत" कैसे हैं, कहते हैं, वे एक पैटर्न के कितने करीब हैं, जिसमें इसे प्रति …

3
जब एक विश्वास अंतराल "समझ में आता है" लेकिन संबंधित विश्वसनीय अंतराल नहीं होता है?
यह अक्सर ऐसा होता है कि 95% कवरेज के साथ एक आत्मविश्वास अंतराल एक विश्वसनीय अंतराल के समान होता है जिसमें 95% घनत्व होता है। यह तब होता है जब पूर्ववर्ती वर्दी या निकटवर्ती वर्दी में होता है। इस प्रकार एक आत्मविश्वास अंतराल का उपयोग अक्सर एक विश्वसनीय अंतराल और …

2
निरंतर डेटा से श्रेणीगत हमेशा गलत है?
जब मैंने आपके डेटा को सेटअप करने के तरीके के बारे में पढ़ा, तो एक बात जो मुझे अक्सर पता चली है, वह यह है कि कुछ निरंतर डेटा को श्रेणीबद्ध डेटा में बदलना एक अच्छा विचार नहीं है, क्योंकि आप बहुत अच्छी तरह से गलत निष्कर्ष निकाल सकते हैं …

2
एक आंकड़े का उदाहरण जो नमूना के वितरण से स्वतंत्र नहीं है?
यह विकिपीडिया पर सांख्यिकी के लिए परिभाषा है औपचारिक रूप से, सांख्यिकीय सिद्धांत एक नमूने के एक कार्य के रूप में एक सांख्यिकीय को परिभाषित करता है जहां फ़ंक्शन स्वयं नमूना के वितरण से स्वतंत्र होता है; वह है, फ़ंक्शन को डेटा की प्राप्ति से पहले बताया जा सकता है। …

2
क्या मैं वितरण के नमूने के वितरण के क्षणों का उपयोग कर सकता हूं?
मैं आंकड़ों / मशीन सीखने के तरीकों में ध्यान देता हूं, एक वितरण अक्सर गौसियन द्वारा अनुमानित किया जाता है, और फिर उस गाऊसी का उपयोग नमूने के लिए किया जाता है। वे वितरण के पहले दो क्षणों की गणना करके शुरू करते हैं, और उन अनुमानों का उपयोग और …

2
द सिम्पसंस (टीवी सीरीज़) भविष्य में "भविष्यवाणियां" करने में इतने सफल क्यों हैं? [बन्द है]
बन्द है। यह सवाल ऑफ टॉपिक है । यह वर्तमान में उत्तर स्वीकार नहीं कर रहा है। इस प्रश्न को सुधारना चाहते हैं? प्रश्न को अपडेट करें ताकि यह क्रॉस मान्य के लिए विषय पर हो । 2 साल पहले बंद हुआ । यह व्यापक रूप से पीले और इतने …

5
मैं कैसे गणना करूं कि क्या मेरे रैखिक प्रतिगमन में एक ज्ञात सैद्धांतिक रेखा से सांख्यिकीय रूप से महत्वपूर्ण अंतर है?
मेरे पास कुछ डेटा है जो लगभग एक रैखिक रेखा के साथ फिट है: जब मैं इन मूल्यों का एक रेखीय प्रतिगमन करता हूं, तो मुझे एक रेखीय समीकरण मिलता है: y=0.997x−0.0136y=0.997x−0.0136y = 0.997x-0.0136 एक आदर्श दुनिया में, समीकरण y = x होना चाहिए ।y=xy=xy = x स्पष्ट रूप से, …

2
क्या काउची वितरण किसी तरह से "अप्रत्याशित" वितरण है?
क्या काउची वितरण किसी तरह से "अप्रत्याशित" वितरण है? मैंने करने की कोशिश की cs <- function(n) { return(rcauchy(n,0,1)) } आर में एन मूल्यों की एक भीड़ के लिए और देखा कि वे कभी-कभी काफी अप्रत्याशित मूल्य उत्पन्न करते हैं। इसकी तुलना उदा as <- function(n) { return(rnorm(n,0,1)) } जो …

3
यदि
सवाल यदि एक्स 1 , ⋯ , एक्स एन ~ एन ( μ , 1 )X1,⋯,Xn∼N(μ,1)X_1,\cdots,X_n \sim \mathcal{N}(\mu, 1) आईआईडी, तो गणना कर रहे हैं ई ( एक्स 1 | टी )E(X1∣T)\mathbb{E}\left( X_1 \mid T \right) जहां, टी = Σ मैं एक्स मैंT=∑iXiT = \sum_i X_i । प्रयास : कृपया …

1
निर्णय वृक्ष की गहराई
चूंकि प्रत्येक चरण में एक विशेषता पर निर्णय ट्री एल्गोरिथ्म विभाजित होता है, इसलिए निर्णय वृक्ष की अधिकतम गहराई डेटा की विशेषताओं की संख्या के बराबर होती है। क्या ये सही है?

6
अधिक महत्वपूर्ण आँकड़ा: 'सभी महिलाओं में से 90 प्रतिशत जीवित रहीं' या 'जो महिलाएं बची थीं उनमें से 90 प्रतिशत महिलाएं थीं'?
निम्नलिखित बयानों पर गौर करें टाइटैनिक: धारणा १: जहाज पर केवल पुरुष और महिलाएँ थे अनुमान 2: महिलाओं के साथ-साथ बड़ी संख्या में पुरुष भी थे कथन १: ९ ० प्रतिशत सभी महिलाएँ बच गईं कथन २: ९ ० प्रतिशत जो बच गए, वे महिलाएं थीं पहला इंगित करता है …

1
क्या बैगिंग एल्गोरिदम यादृच्छिक वन के उत्तराधिकारी के योग्य हैं?
एल्गोरिदम को बढ़ावा देने के लिए, मैं कहूंगा कि वे बहुत अच्छी तरह से विकसित हुए हैं। 1995 की शुरुआत में AdaBoost को पेश किया गया था, फिर कुछ समय बाद यह ग्रैडिएंट बूस्टिंग मशीन (GBM) थी। हाल ही में, 2015 के आसपास XGBoost पेश किया गया था, जो सटीक …

3
लागू वैज्ञानिकों के साथ सहयोग पर सलाह
मैं सांख्यिकी में स्नातक छात्र हूं और इस तरह लागू वैज्ञानिकों (अर्थशास्त्रियों, वनपाल,…) के साथ सहयोग के एक जोड़े में शामिल हूं। ये सहयोग मज़ेदार हैं (ज्यादातर समय) और मैं बहुत कुछ सीखता हूं, लेकिन कुछ जटिलताएं भी हैं, उदाहरण के लिए: कभी-कभी किसी अच्छे सांख्यिकीय मॉडल के बारे में …
14 references 

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.