सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

4
सशर्त संभावना के लिए अंतर्ज्ञान कैसे विकसित करें?
हार्वर्ड के सांख्यिकी 110: प्रायिकता पाठ्यक्रम जो कि आईट्यून्स और यूट्यूब पर मिल सकता है, से वीडियो लेक्चर में , मुझे इस समस्या का सामना करना पड़ा । मैंने इसे यहाँ संक्षेप में बताने की कोशिश की है: मान लीजिए कि हमें एक मानक डेक से एक यादृच्छिक दो-कार्ड हाथ …

1
सेटिंग में प्रतिगमन : नियमितीकरण विधि (लासो, पीएलएस, पीसीआर, रिज) कैसे चुनें?
मैं यह देखने की कोशिश कर रहा हूं कि रिज रिग्रेशन , LASSO , प्रिंसिपल कंपोनेंट रिग्रेशन (PCR), या आंशिक लिटर स्क्वेयर (PLS) ऐसी स्थिति में जाना चाहिए, जहां बड़ी संख्या में वैरिएबल / फीचर्स ( ppp ) और कम संख्या में सैंपल हों ( n<pn<pn n , अधिकांश समय …

2
GLM के लिए परिवर्तन को सामान्य बनाने की व्युत्पत्ति
\newcommand{\E}{\mathbb{E}} कैसे है एक ( ⋅ ) = ∫ घ यूवी 1 / 3 ( μ )A(⋅)=∫duV1/3(μ)A(\cdot) = \displaystyle\int\frac{du}{V^{1/3}(\mu)} सामान्य घातीय परिवार के लिए बदलना निकाली गई? अधिक विशेष रूप से : मैंने पेज 3 पर टेलर विस्तार स्केच का पालन करने की कोशिश की, यहां 1 स्लाइड करें लेकिन …

2
क्रमपरिवर्तन परीक्षण में 0 के बराबर पी-मान
मेरे पास दो डेटासेट हैं और मैं जानना चाहूंगा कि क्या वे महत्वपूर्ण रूप से भिन्न हैं या नहीं (यह " दो समूहों में काफी भिन्न है? परीक्षण का उपयोग करने के लिए ")। मैंने निम्नलिखित में आर करते हुए एक क्रमचय परीक्षण का उपयोग करने का निर्णय लिया: permutation.test …

1
क्या मुझे अत्यधिक तिरछे डेटा पर टी-टेस्ट का उपयोग करना चाहिए? वैज्ञानिक प्रमाण, कृपया?
मेरे पास उपयोगकर्ताओं की भागीदारी (जैसे: पोस्ट की संख्या) के बारे में एक अत्यधिक तिरछी (एक घातांक वितरण की तरह) डेटासेट के नमूने हैं, जिनके विभिन्न आकार हैं (लेकिन 200 से कम नहीं) और मैं उनके मतलब की तुलना करना चाहता हूं। उसके लिए, मैं दो-नमूना अनपेक्षित टी-परीक्षणों का उपयोग …

2
क्लस्टरिंग के लिए मिश्रण मॉडल कैसे फिट करें
मेरे दो चर हैं- X और Y और मुझे क्लस्टर अधिकतम बनाने की आवश्यकता है (और इष्टतम) = 5. चलो आदर्श चर का आदर्श प्लॉट निम्नानुसार है: मैं इसके 5 क्लस्टर बनाना चाहूंगा। कुछ इस तरह: इस प्रकार मुझे लगता है कि यह 5 समूहों के साथ मिश्रण मॉडल है। …

4
विमान दुर्घटनाओं का एक समूह कितना अजीब है?
मूल प्रश्न (ation/२५/१४): क्या समाचार माध्यमों के इस उद्धरण से समझ में आता है, या हाल ही में हुए विमान दुर्घटनाओं के मद्देनजर देखने का एक बेहतर सांख्यिकीय तरीका है? हालांकि, बार्नेट पोइसन वितरण के सिद्धांत पर भी ध्यान आकर्षित करते हैं, जिसका अर्थ है कि क्रैश के बीच छोटे …

1
क्या यह एक पूंछ वाले कोलमोगोरोव-स्मिर्नोव परीक्षण करने के लिए समझ में आता है?
क्या एक-पूंछ वाले केएस परीक्षण करना सार्थक और संभव है? ऐसी परीक्षा की अशक्त परिकल्पना क्या होगी? या केएस परीक्षण स्वाभाविक रूप से दो-पूंछ वाला परीक्षण है? मुझे एक उत्तर से लाभ होगा, जिसने मुझे डी के वितरण को समझने में मदद की (मैं मैसी के 1951 के पेपर के …

3
अत्यधिक असंतुलित सेटिंग में लागत-संवेदनशील सीखने के सुझाव
मेरे पास कुछ मिलियन पंक्तियों और ~ 100 कॉलमों के साथ एक डेटासेट है। मैं डेटासेट में 1% उदाहरणों का पता लगाना चाहूंगा, जो एक सामान्य वर्ग के हैं। मेरे पास एक न्यूनतम परिशुद्धता बाधा है, लेकिन बहुत ही असममित लागत के कारण मैं किसी भी विशेष याद के लिए …

3
मेरा वितरण सामान्य है; Kolmogorov-Smirnov परीक्षण सहमत नहीं है
मेरे पास कुछ डेटा की सामान्यता के साथ एक समस्या है: मैंने कोलमोगोरोव परीक्षण किया है जो कहता है कि यह पी = .0000 के साथ नहीं है, मुझे समझ में नहीं आता है: मेरे वितरण का तिरछा होना = - 497, और द कर्टोसिस = -0,024 यहाँ मेरे वितरण …

3
विषमलैंगिक डेटा के विचरण का पूर्वानुमान
मैं विषमलैंगिक डेटा पर एक प्रतिगमन करने की कोशिश कर रहा हूं, जहां मैं त्रुटि के रूप में और साथ ही रैखिक मॉडल के संदर्भ में औसत मानों की भविष्यवाणी करने की कोशिश कर रहा हूं । कुछ इस तरह: y(x,t)ξ(x,t)y¯(x,t)σ(x,t)=y¯(x,t)+ξ(x,t),∼N(0,σ(x,t)),=y0+ax+bt,=σ0+cx+dt.y(x,t)=y¯(x,t)+ξ(x,t),ξ(x,t)∼N(0,σ(x,t)),y¯(x,t)=y0+ax+bt,σ(x,t)=σ0+cx+dt.\begin{align}\\ y\left(x,t\right) &= \bar{y}\left(x,t\right)+\xi\left(x,t\right),\\ \xi\left(x,t\right) &\sim N\left(0,\sigma\left(x,t\right)\right),\\ \bar{y}\left(x,t\right) &= y_{0}+ax+bt,\\ …

1
सांख्यिकी और मशीन सीखने की शर्तों के लिए थिसॉरस
क्या आँकड़े और मशीन सीखने की शर्तों के लिए कोई संदर्भ थिसॉरस मौजूद है? मुझे पता है कि विकिपीडिया के लेखों में अक्सर समानार्थी शब्द होते हैं, लेकिन मैं एक मात्र थिसॉरस रखना चाहूंगा जिसे मैं आसानी से (बनाम एक पूर्ण विश्वकोश) के माध्यम से जा सकता हूं ताकि यह …

2
रिज रिग्रेशन - बायेसियन व्याख्या
मैंने सुना है कि रिज प्रतिगमन को पूर्ववर्ती वितरण के माध्यम के रूप में प्राप्त किया जा सकता है, यदि पूर्व पर्याप्त रूप से चुना गया हो। क्या अंतर्ज्ञान है कि पूर्व के द्वारा प्रतिगमन गुणांक पर निर्धारित बाधाओं (जैसे मानक सामान्य वितरण 0 के आसपास) समान हैं / गुणांक …

6
ध्रुवीकृत उपयोगकर्ता राय (उच्च और निम्न स्टार रेटिंग) का पता कैसे लगाएं
अगर मेरे पास एक स्टार रेटिंग प्रणाली है जहां उपयोगकर्ता किसी उत्पाद या आइटम के लिए अपनी प्राथमिकता व्यक्त कर सकते हैं, तो मैं कैसे सांख्यिकीय रूप से पता लगा सकता हूं यदि वोट अत्यधिक "विभाजित" हैं। मतलब, भले ही किसी दिए गए उत्पाद के लिए औसत 5 में से …

1
गनी घटती है और गिन्नी अशुद्धता बच्चों की
मैं यादृच्छिक जंगल के लिए Gini सुविधा महत्व के उपाय पर काम कर रहा हूं। इसलिए, मुझे नोड की अशुद्धता में गिनी की कमी की गणना करने की आवश्यकता है। यहाँ मैं ऐसा कर रहा हूँ, जो परिभाषा के साथ संघर्ष की ओर ले जाता है, यह सुझाव देता है …

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.