सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

3
मैं प्रोग्राम को अलग-अलग घटता के साथ फिट करने के लिए डेटा श्रृंखला के खंडों का पता कैसे लगा सकता हूं?
क्या किसी भी दिए गए डेटासेट के अलग-अलग वर्गों को सर्वश्रेष्ठ फिट के अलग-अलग घटता में अलग-अलग दस्तावेज हैं? उदाहरण के लिए, डेटा के इस चार्ट को देखने वाले अधिकांश मनुष्य इसे आसानी से 3 भागों में विभाजित करेंगे: एक साइनसोइडल सेगमेंट, एक रैखिक खंड और व्युत्क्रम घातीय खंड। वास्तव …

3
काज हानि बनाम लॉजिस्टिक नुकसान के फायदे और नुकसान / सीमाएं
काज हानि को का उपयोग करके परिभाषित किया जा सकता है और लॉग नुकसान को लॉग ( 1 + exp ( - y i w T x i ) के रूप में परिभाषित किया जा सकता है )अधिकतम ( 0 , 1 - yमैंwटीएक्समैं)अधिकतम(0,1-yमैंwटीएक्समैं)\text{max}(0, 1-y_i\mathbf{w}^T\mathbf{x}_i)लॉग ( 1 + ऍक्स्प)- ( …

3
OLS अनुमानक प्राप्त करने के लिए मान्यताओं
क्या कोई मेरे लिए संक्षेप में बता सकता है कि ओएलएस अनुमानक की गणना करने के लिए छह में से प्रत्येक की आवश्यकता क्यों है? मैंने केवल बहु-संस्कृति के बारे में पाया- कि यदि यह मौजूद है तो हम (X'X) मैट्रिक्स को उल्टा नहीं कर सकते हैं और बदले में …

4
नमूना आकार बहुत बड़ा होने पर आत्मविश्वास अंतराल
मेरे प्रश्न को "बड़े डेटा का उपयोग करके एक नमूना त्रुटि का आकलन कैसे करें" के रूप में प्रतिरूपित किया जा सकता है, विशेष रूप से एक जर्नल प्रकाशन के लिए। यहाँ एक चुनौती को चित्रित करने के लिए एक उदाहरण है। एक बहुत बड़े डेटासेट से (> 100 अस्पतालों …

1
मिश्रित प्रभाव मॉडल निर्भरता का समाधान क्यों करते हैं?
कहो कि हम रुचि रखते हैं कि उन छात्रों द्वारा अध्ययन किए जाने वाले घंटों की संख्या से छात्र परीक्षा ग्रेड कैसे प्रभावित होते हैं। इस संबंध का पता लगाने के लिए, हम निम्नलिखित लीनियर रिग्रेशन को चला सकते हैं: exam.gradesi=a+β1×hours.studiedi+eiexam.gradesi=a+β1×hours.studiedi+ei \text{exam.grades}_i = a + \beta_1 \times \text{hours.studied}_i + e_i …

1
क्यों बेगियन पदानुक्रमित मॉडल में लैग प्रभाव वृद्धि का मतलब है कि विचलन को जोड़ना है?
बैकग्राउंड: मैं वर्तमान में विभिन्न बायेसियन पदानुक्रमित मॉडल की तुलना में कुछ काम कर रहा हूं। डेटा yमैं जेyमैंजेy_{ij} भागीदार के लिए अच्छी तरह से किया जा रहा है के संख्यात्मक उपाय कर रहे हैं मैंमैंi और समय जेजेj । मेरे पास लगभग 1000 प्रतिभागी हैं और प्रति प्रतिभागी में …

2
बेतरतीब से विभिन्न परिणाम कैरेट और बेसिक randomForest पैकेज के माध्यम से
मैं थोड़ा उलझन में हूं: कैरेट के माध्यम से प्रशिक्षित मॉडल के परिणाम मूल पैकेज में मॉडल से कैसे भिन्न हो सकते हैं? मैंने पढ़ा कि क्या कैरेट पैकेज के साथ रैंडमफॉरस्ट के फाइनलमॉडल का उपयोग करने से पहले प्रीप्रोसेसिंग की आवश्यकता है? लेकिन मैं यहां किसी भी प्रीप्रोसेसिंग का …

2
GLM: वितरण और लिंक फ़ंक्शन की पसंद की पुष्टि करना
मेरे पास एक सामान्यीकृत रैखिक मॉडल है जो एक गाऊसी वितरण और लॉग लिंक फ़ंक्शन को गोद लेता है। मॉडल को फिट करने के बाद, मैं अवशिष्टों की जांच करता हूं: क्यूक्यू प्लॉट, अवशिष्ट बनाम अनुमानित मान, अवशिष्ट के हिस्टोग्राम (यह मानते हुए कि सावधानी बरतने की जरूरत है)। सब …

1
लॉजिस्टिक रिग्रेशन और सपोर्ट वेक्टर मशीनों के बीच अंतर?
मुझे पता है कि लॉजिस्टिक रिग्रेशन एक हाइपरप्लेन का पता लगाता है जो प्रशिक्षण के नमूनों को अलग करता है। मुझे यह भी पता है कि सपोर्ट वेक्टर मशीनें हाइपरप्लेन को अधिकतम मार्जिन के साथ ढूंढती हैं। मेरा प्रश्न: अंतर है तो लॉजिस्टिक रिग्रेशन (LR) और सपोर्ट वेक्टर मशीन (SVM) …

1
हम क्वांटिल्स और माध्यिका के बजाय टैंटाइल्स और मेडियल का उपयोग कब करेंगे?
विकिपीडिया या वोल्फग्राम मैथवर्ल्ड पर मैं या तो तांत्रिक या मध्ययुगीन के लिए परिभाषा नहीं पा सकता हूं, लेकिन निम्नलिखित विवरण Bílková, D. और Mala, I. (2012) में दिए गए हैं, " आय वितरण मॉडलिंग करते समय एल-पल पद्धति का अनुप्रयोग। चेक गणराज्य में , सांख्यिकी के ऑस्ट्रियाई जर्नल , …

1
क्या स्टैक किए गए ऑटोएन्कोडर और 2-लेयर न्यूरल नेटवर्क के प्रशिक्षण के बीच कोई अंतर है?
मान लीजिए कि मैं 2-लेयर स्टैक्ड ऑटोएन्कोडर और 2-लेयर न्यूरल नेटवर्क के निर्माण के लिए एक एल्गोरिथम लिख रहा हूं। क्या वे समान चीजें या अंतर हैं? मुझे क्या समझ में आता है कि जब मैं एक खड़ी ऑटोकेनोडर का निर्माण करता हूं, तो मैं परत दर परत निर्माण करूंगा। …

1
विस्तार (गुणांक) से लेकर विषम अनुपात और कारकों के साथ लॉजिस्टिक रिग्रेशन में उनकी व्याख्या
मैं सैट स्कोर और परिवार / जातीय पृष्ठभूमि के खिलाफ कॉलेज में स्वीकृति का एक रैखिक प्रतिगमन चला गया। डेटा काल्पनिक हैं। यह एक पूर्व प्रश्न पर अनुवर्ती है, पहले से ही उत्तर दिया गया है। सवाल यह है कि सादगी के लिए सैट स्कोर को छोड़ते समय बाधाओं और …
14 r  regression  logistic 

1
सेम मीन, डिफरेंट वेरियस
मान लीजिए कि आपके पास आठ धावक दौड़ रहे हैं; उनके व्यक्तिगत रन समय का वितरण सामान्य है और प्रत्येक का मतलब 111111 सेकंड है, कहते हैं। धावक एक का मानक विचलन सबसे छोटा, दो दूसरा सबसे छोटा, तीसरा सबसे छोटा, आदि, और आठ सबसे बड़ा है। दो सवाल मुझे …

2
क्लस्टरिंग के लिए डिरिचलेट प्रक्रियाएं: लेबल से कैसे निपटें?
प्रश्न: एक डिरिचलेट प्रक्रिया का उपयोग करके डेटा को क्लस्टर करने का मानक तरीका क्या है? गिब्स के नमूने का उपयोग करते समय नमूने दिखाई देते हैं और नमूने के दौरान गायब हो जाते हैं। इसके अलावा, हमारे पास पहचान की समस्या है क्योंकि पीछे वितरण क्लस्टर क्लस्टरिंग के लिए …

2
बूटस्ट्रैप के पुनरुत्पादन पर सर्वोत्तम सुझावित पाठ्यपुस्तकें?
मैं सिर्फ यह पूछना चाहता हूं कि आपकी राय में बूटस्ट्रैप पर सबसे अच्छी उपलब्ध किताबें कौन सी हैं। इसके द्वारा मैं केवल अपने डेवलपर्स द्वारा लिखित एक का मतलब नहीं है। क्या आप यह बता सकते हैं कि निम्नलिखित मापदंड को शामिल करने वाले बूटस्ट्रैप के लिए कौन सी …

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.