सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

4
गैर-पैरामीट्रिक आंकड़ों का परिचय
मैं पिछले दो वर्षों से आँकड़ों का अध्ययन कर रहा हूँ। लगभग मैंने जो कुछ भी सीखा है वह पैरामीट्रिक आंकड़ों के बारे में है। अब मैं गैर-पैरामीट्रिक आंकड़ों के बारे में और जानना चाहूंगा। क्या कोई इस क्षेत्र में कुछ संक्षिप्त (शायद पठनीय और साथ ही) परिचय का सुझाव …

3
एक बड़ी बाइनरी डेटासेट को कुछ श्रेणियों में क्लस्टर करने के लिए मुझे किस एल्गोरिथ्म का उपयोग करना चाहिए?
मेरे पास एक बड़ी (650K पंक्तियाँ * 62 कॉलम) बाइनरी डेटा का मैट्रिक्स (केवल 0-1 प्रविष्टियाँ) हैं। मैट्रिक्स ज्यादातर विरल है: लगभग 8% भरा हुआ है। मैं इसे 5 समूहों में बांटना चाहूंगा - 1 से 5 तक नामांकित कहो। मैंने श्रेणीबद्ध क्लस्टरिंग की कोशिश की है और यह आकार …

1
मात्रात्मक प्रतिगमन अनुमानक सूत्र
मैंने मात्रात्मक प्रतिगमन अनुमानक के दो अलग-अलग अभ्यावेदन देखे हैं जो हैं क्यू ( β)क्ष) = ∑मैं : वाईमैं≥ x'मैंβnक्ष∣ यमैं- एक्स'मैंβक्ष| + Σमैं : वाईमैं&lt; एक्स'मैंβn( 1 - q) ∣ यमैं- एक्स'मैंβक्ष|Q(βq)=∑i:yi≥xi′βnq∣yi−xi′βq∣+∑i:yi&lt;xi′βn(1−q)∣yi−xi′βq∣Q(\beta_{q}) = \sum^{n}_{i:y_{i}\geq x'_{i}\beta} q\mid y_i - x'_i \beta_q \mid + \sum^{n}_{i:y_{i}< x'_{i}\beta} (1-q)\mid y_i - x'_i \beta_q …

2
मानक त्रुटि प्राप्त करने के लिए सामान्य विधि
मैं कहीं भी मानक त्रुटियों को प्राप्त करने के लिए एक सामान्य विधि खोजने के लिए प्रतीत नहीं कर सकता। मैंने Google, इस वेबसाइट और यहां तक ​​कि पाठ्य पुस्तकों में भी देखा है, लेकिन सभी मैं पा सकता हूं कि मीन, विचरण, अनुपात, जोखिम अनुपात, आदि के लिए मानक …

1
पीछे-पीछे आत्मविश्वास का अंतराल
इस चर्चा में आने के बाद, मैं इस सवाल को वापस ले रहा हूं कि आत्मविश्वास से भरे अंतराल अंतराल। इस लेख के अनुसार लॉग-नॉर्मल रैंडम वेरिएबल के मतलब के लिए नाममात्र कवरेज बैक-ट्रांसफ़ॉर्मेड CI है: LCL(X)=exp(Y+var(Y)) यूसीएल ( एक्स)) = एक्सप( य+ वार ( वाई)2+ zvar ( Y))n+ वार …

1
तिरछा सामान्य वितरण के लिए पैरामीटर का अनुमान
तिरछा-सामान्य के लिए फॉर्मूला पैरामीटर अनुमान क्या हैं? यदि आप कर सकते हैं, तो MLE या माँ के माध्यम से व्युत्पत्ति भी बहुत अच्छी होगी। धन्यवाद संपादित करें । मेरे पास डेटा का एक सेट है जिसके लिए मैं प्लॉट द्वारा नेत्रहीन बता सकता हूं कि बाईं ओर थोड़ा तिरछा …

2
औसत सहसंबंध गुणांक का महत्व
डिस्क्लेमर: यदि आपको यह प्रश्न किसी दूसरे के समान लगता है, तो मैं इसके विलय से खुश हूं। हालांकि, मुझे कहीं और (और टिप्पणी या उत्थान के लिए "प्रतिष्ठा" नहीं है) एक संतोषजनक जवाब नहीं मिला, इसलिए मैंने सोचा कि खुद से एक नया सवाल पूछना सबसे अच्छा होगा। मेरा …

3
कम से कम वर्ग एक बुरा विचार कब होगा?
यदि मेरे पास प्रतिगमन मॉडल है: जहां और ,Y=Xβ+εY=Xβ+ε Y = X\beta + \varepsilon V[ε]=Id∈Rn×nवी[ε]=मैंघ∈आरn×n\mathbb{V}[\varepsilon] = Id \in \mathcal{R} ^{n \times n}E[ε]=(0,…,0)इ[ε]=(0,...,0)\mathbb{E}[\varepsilon]=(0, \ldots , 0) का उपयोग करते समय होगा साधारण कम से कम वर्गों आकलनकर्ता की, , एक आकलनकर्ता के लिए एक गरीब विकल्प हो?βOLSβOLS\beta_{\text{OLS}}ββ\beta मैं एक उदाहरण जानने …

3
पहला मुख्य घटक अलग-अलग कक्षाएं नहीं करता है, लेकिन अन्य पीसी करते हैं; वो कैसे संभव है?
मैंने पीसीए को 17 मात्रात्मक चर पर चलाया, ताकि चर का एक छोटा सेट प्राप्त किया जा सके, जो कि प्रमुख घटक हैं, जिसका उपयोग दो वर्गों में वर्गीकरण उदाहरणों के लिए पर्यवेक्षित मशीन सीखने में किया जाता है। PCA के बाद डेटा में विचरण के 31% के लिए PC1 …

1
क्या सर्वेक्षणमोनकी इस तथ्य की अनदेखी करता है कि आपको एक गैर-यादृच्छिक नमूना मिलता है?
SurveyMonkey में आपके जनसंख्या आकार के आधार पर त्रुटि या विश्वास अंतराल के दिए गए मार्जिन के लिए आपको कौन सा नमूना आकार चाहिए, यह पता लगाने के लिए चरण और एक चार्ट है। सर्वेमोंकी नमूना आकार क्या यह चार्ट केवल इस तथ्य को अनदेखा करता है कि आपको एक …

3
किस दूरी का उपयोग करना है? जैसे, मैनहट्टन, यूक्लिडियन, ब्रे-कर्टिस आदि
मैं सामुदायिक पारिस्थितिकीविज्ञानी नहीं हूं, लेकिन इन दिनों मैं सामुदायिक पारिस्थितिकी डेटा पर काम कर रहा हूं। इन दूरियों के गणित के अलावा जो मैं समझ नहीं सका, वह यह है कि प्रत्येक दूरी का उपयोग करने के लिए और किन स्थितियों में इसे लागू किया जा सकता है। उदाहरण …

1
संभावना अनुपात परीक्षण और वाल्ड परीक्षण आर में चमक के लिए अलग निष्कर्ष प्रदान करते हैं
मैं सामान्यीकृत, रैखिक और मिश्रित मॉडल से एक उदाहरण प्रस्तुत कर रहा हूं । मेरा MWE नीचे है: Dilution &lt;- c(1/128, 1/64, 1/32, 1/16, 1/8, 1/4, 1/2, 1, 2, 4) NoofPlates &lt;- rep(x=5, times=10) NoPositive &lt;- c(0, 0, 2, 2, 3, 4, 5, 5, 5, 5) Data &lt;- data.frame(Dilution, NoofPlates, …

4
पायथन में प्रमुख घटक विश्लेषण और प्रतिगमन
मैं यह पता लगाने की कोशिश कर रहा हूं कि पायस में कुछ काम जो मैंने एसएएस में किए हैं, कैसे पुन: पेश करें। इस डेटासेट का उपयोग करना , जहां बहुसंस्कृति एक समस्या है, मैं पायथन में प्रमुख घटक विश्लेषण करना चाहूंगा। मैंने स्किटिट-लर्न और स्टैटमोडेल को देखा है, …

3
यदि मेरा डेटा सामान्य वितरण में फिट बैठता है तो कैसे जांचें?
Rअगर मेरा डेटा लॉग-नॉर्मल या पेरेटो डिस्ट्रीब्यूशन में फिट बैठता है , तो मैं जांचना चाहता हूं । ऐसा कैसे किया जा सकता था? शायद ks.testमुझे ऐसा करने में मदद मिल सकती है, लेकिन मैं अपने डेटा के लिए Pareto वितरण के लिए the और पैरामीटर कैसे प्राप्त कर सकता …

1
एक सजा तंत्रिका नेटवर्क का प्रशिक्षण
मैं वर्तमान में एक फेस रिकग्निशन सॉफ्टवेयर पर काम कर रहा हूं जो चेहरे को पहचानने के लिए कनवल्शन न्यूरल नेटवर्क का उपयोग करता है। अपने रीडिंग के आधार पर, मैं इकट्ठा हुआ हूं कि एक दृढ़ तंत्रिका नेटवर्क ने वजन साझा किया है, ताकि प्रशिक्षण के दौरान समय की …

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.