सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

1
कैरट glmnet बनाम cv.glmnet
वहाँ का उपयोग कर की तुलना में भ्रम का एक बहुत हो रहा है glmnetके भीतर caretएक इष्टतम लैम्ब्डा के लिए खोज करने के लिए और का उपयोग कर cv.glmnetएक ही काम करने के लिए। कई सवाल किए गए, उदाहरण के लिए: वर्गीकरण मॉडल train.glmnet बनाम cv.glmnet? कैरट के साथ …

1
एक सहज व्याख्या क्यों बेंजामिनी-होचबर्ग एफडीआर प्रक्रिया काम करती है?
क्या यह समझाने का एक सरल तरीका है कि बेंजामिन और होचबर्ग की (1995) प्रक्रिया वास्तव में झूठी खोज दर (एफडीआर) को कैसे नियंत्रित करती है? यह प्रक्रिया इतनी सुरुचिपूर्ण और कॉम्पैक्ट है और फिर भी यह प्रमाण है कि यह स्वतंत्रता के तहत क्यों काम करता है (उनके 1995 …

1
लॉजिस्टिक रिग्रेशन में इंटरसेप्ट मॉडल के साथ या उसके बीच का अंतर
मुझे लॉजिस्टिक रिग्रेशन में इंटरसेप्ट मॉडल के साथ या उसके बीच के अंतर को समझना अच्छा लगता है क्या उनके बीच कोई अंतर है सिवाय इसके कि अंतरविरोधी बेसलाइन समूह के सापेक्ष लॉग (ऑड्स अनुपात) के संबंध में और इंटरसेप्ट के बिना वे लॉग (ऑड्स) के संबंध में हैं? मैंने …

3
रैखिक प्रतिगमन एफ सांख्यिकीय, आर चुकता और अवशिष्ट मानक त्रुटि हमें क्या बताती है?
मैं निम्नलिखित शब्दों के रैखिक प्रतिगमन के संदर्भ में अर्थ के अंतर के बारे में वास्तव में उलझन में हूं: एफ स्टेटिस्टिक आर चुकता अवशिष्ट मानक त्रुटि मैंने इस वेबस्टी को पाया , जिसने मुझे रेखीय प्रतिगमन में शामिल विभिन्न शब्दों में बहुत अंतर्दृष्टि दी, हालांकि ऊपर उल्लिखित शब्द एक …

1
द्विपद यादृच्छिक चर के लिए भविष्यवाणी अंतराल
द्विपद यादृच्छिक चर के लिए एक भविष्यवाणी अंतराल के लिए सूत्र (अनुमानित या सटीक) क्या है? मान लें , और हम ( से खींचा हुआ ) का निरीक्षण करते हैं । जाना जाता है।Y∼Binom(n,p)Y∼Binom(n,p)Y \sim \mathsf{Binom}(n, p)yyyYYYnnn हमारा लक्ष्य से एक नए ड्रॉ के लिए 95% भविष्यवाणी अंतराल प्राप्त करना …

3
राजनीति के लिए सांख्यिकीय नमूनाकरण कार्य (जैसे गैलप) क्यों / करना चाहिए?
वहां के लोग (कहते हैं, गैलप) जनसंख्या के आकार की तुलना में कुछ बेतुके रूप से कम संख्या में लोगों का नमूना लेते हैं (जैसे कि शायद लाखों लोगों में से एक लाख लोग)। अब, मेरे लिए, जनसंख्या के आँकड़ों के आकलन के लिए एक साधन के रूप में जनसंख्या …

2
ऑटोएन्कोडर तंत्रिका नेटवर्क की उत्पत्ति क्या है?
मैंने Google, विकिपीडिया, Google के विद्वान, और बहुत कुछ खोजा, लेकिन मुझे Autoencoders की उत्पत्ति नहीं मिली। शायद यह उन अवधारणाओं में से एक है जो बहुत धीरे-धीरे विकसित हुई, और एक स्पष्ट शुरुआती बिंदु का पता लगाना असंभव है, लेकिन फिर भी मैं उनके विकास के मुख्य चरणों के …

2
Benjamini-Hochberg समायोजित पी-मूल्य के लिए सूत्र क्या है?
मैं प्रक्रिया को समझता हूं और यह क्या नियंत्रित करता है। तो कई तुलनाओं के लिए BH प्रक्रिया में समायोजित पी-मान का सूत्र क्या है? बस अब मैंने महसूस किया कि मूल BH समायोजित पी-मानों का उत्पादन नहीं करता था, केवल समायोजित (गैर) अस्वीकृति स्थिति: https://www.jstor.org/stable/2346101 । गॉर्डन स्माइथ ने …

4
मशीन लर्निंग एल्गोरिदम के लिए भविष्यवाणी अंतराल
मैं जानना चाहता हूं कि क्या नीचे वर्णित प्रक्रिया वैध / स्वीकार्य और उपलब्ध कोई औचित्य है। यह विचार: पर्यवेक्षित शिक्षण एल्गोरिदम डेटा के बारे में अंतर्निहित संरचनाओं / वितरणों को नहीं मानते हैं। दिन के अंत में वे आउटपुट पॉइंट अनुमान लगाते हैं। मैं किसी भी तरह अनुमानों की …

2
do (x) ऑपरेटर अर्थ?
मैंने ऑपरेटर को हर जगह कुछ साहित्य समीक्षा में देखा है जो मैं Causality (उदाहरण के लिए, इस विकी प्रविष्टि ) पर कर रहा हूं । हालाँकि, मुझे इस ऑपरेटर की औपचारिक और सामान्य परिभाषा नहीं मिल रही है।घओ ( एक्स )do(x)do(x) क्या कोई मुझे इस पर एक अच्छा संदर्भ …

1
कोलमोगोरोव-स्मिरनोव परीक्षण बनाम टी-टेस्ट
मुझे 2 नमूना केएस परीक्षण की व्याख्या को समझने में कुछ कठिनाई हो रही है, और यह 2 समूहों के बीच एक नियमित टी परीक्षण से कैसे अलग है। आइए बताते हैं कि मेरे पास कुछ कार्य करने वाले पुरुष और महिलाएं हैं और मैं उस कार्य से कुछ स्कोर …

3
अनुदैर्ध्य बड़े डेटा को कैसे मॉडल करें?
परंपरागत रूप से हम अनुदैर्ध्य डेटा को मॉडल करने के लिए मिश्रित मॉडल का उपयोग करते हैं, जैसे डेटा: id obs age treatment_lvl yield 1 0 11 M 0.2 1 1 11.5 M 0.5 1 2 12 L 0.6 2 0 17 H 1.2 2 1 18 M 0.9 हम …

1
सामान्यीकृत एडिटिव मॉडल पायथन लाइब्रेरीज़
मुझे पता है कि आर में सामान्यीकृत योजक मॉडल के लिए गम और mgcv लाइब्रेरी हैं। लेकिन मुझे पायथन इकोसिस्टम में उनके समकक्षों को ढूंढने में कठिनाई हो रही है (आँकड़ेमॉडल में केवल सैंडबॉक्स में प्रोटोटाइप है)। क्या किसी को मौजूदा अजगर पुस्तकालयों के बारे में पता है? कौन जानता …
14 gam 

3
रिज रिग्रेशन में रिग्रेशन गुणांक
रिज प्रतिगमन में, उद्देश्य समारोह को कम से कम किया जा रहा है: RSS+λ∑β2j.RSS+λ∑βj2.\text{RSS}+\lambda \sum\beta_j^2. क्या यह लैगेंज गुणक विधि का उपयोग करके अनुकूलित किया जा सकता है? या यह सीधे भेदभाव है?

1
GAM बनाम लोड बनाम विभाजन
प्रसंग : मैं इसलिए मैं उपयोग कर रहा हूँ एक scatterplot कि पैरामीट्रिक प्रकट नहीं होता है में एक रेखा खींच करना चाहते हैं, geom_smooth()में ggplotमें R। यह स्वचालित रूप से रिटर्न करता है geom_smooth: method="auto" and size of largest group is >=1000, so using gam with formula: y ~ …

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.