सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

2
सशर्त स्वतंत्रता और इसके चित्रमय प्रतिनिधित्व के बारे में
सहसंयोजक चयन का अध्ययन करते समय, मैं एक बार निम्नलिखित उदाहरण पढ़ता हूं। निम्नलिखित मॉडल के संबंध में: इसके सहसंयोजक मैट्रिक्स और व्युत्क्रम सहसंयोजक मैट्रिक्स निम्नानुसार दिए गए हैं, मुझे समझ नहीं आ रहा है कि और y की स्वतंत्रता का निर्णय यहाँ उलटा सहसंयोजक द्वारा क्यों किया जाता है?xxxyyy …

2
फीचर हैशिंग को समझना
विकिपीडिया सुविधा हैशिंग का वर्णन करते समय निम्नलिखित उदाहरण प्रदान करता है ; लेकिन मैपिंग परिभाषित शब्दकोश के अनुरूप नहीं लगती है उदाहरण के लिए, शब्दकोश के अनुसार toपरिवर्तित किया जाना चाहिए 3, लेकिन यह 1इसके बजाय एन्कोडेड है । क्या वर्णन में कोई त्रुटि है? फीचर हैशिंग कैसे काम …

1
सरल आर एलएम मॉडल से लॉग-लाइक को फिर से करें
मैं केवल dnorm () लॉग-लाइक फ़ंक्शन द्वारा प्रदान किए जाने वाले लॉग-लाइक फ़ंक्शन को एक lm मॉडल (R) से प्राप्त करने की कोशिश कर रहा हूं। यह उच्च संख्या में डेटा के लिए काम करता है (लगभग पूरी तरह से) (जैसे n = 1000): > n <- 1000 > x …

1
एक आनुपातिक और द्विपद वितरण के साथ नमूना आकार का निर्धारण
मैं पुस्तक, बायोमेट्री द्वारा सोकल और रोहेल (3e) का उपयोग करके कुछ आंकड़े सीखने की कोशिश कर रहा हूं। यह 5 वें अध्याय में एक अभ्यास है जिसमें संभावना, द्विपद वितरण और पॉइसन वितरण शामिल हैं। मुझे पता है कि इस प्रश्न का उत्तर तैयार करने का एक सूत्र है: …

1
निर्णय वृक्ष चर (सुविधा) स्केलिंग और चर (सुविधा) सामान्यीकरण (ट्यूनिंग) किस कार्यान्वयन में आवश्यक है?
कई मशीन लर्निंग एल्गोरिदम में, फीचर स्केलिंग (उर्फ वैरिएबल स्केलिंग, नॉर्मलाइजेशन) विकिपीडिया - फ़ीचर स्केलिंग का एक सामान्य प्रीपोसिंग चरण है - यह प्रश्न करीब # 41704 था - सामान्यीकरण और फ़ीचर स्केलिंग का काम कैसे और क्यों होता है? निर्णय वृक्षों के संबंध में मेरे दो प्रश्न हैं: क्या …

4
सांख्यिकीय महत्व पर वर्तमान बहस के निहितार्थ
पिछले कुछ वर्षों में, विभिन्न विद्वानों ने वैज्ञानिक परिकल्पना परीक्षण की एक हानिकारक समस्या को उठाया है, जिसे "स्वतंत्रता की शोधकर्ता डिग्री" कहा जाता है, जिसका अर्थ है कि वैज्ञानिकों के पास अपने विश्लेषण के दौरान कई विकल्प हैं जो पी-मान <5% के साथ खोजने की दिशा में पूर्वाग्रह रखते …

1
क्या मुझे वेल्च (1947) को स्वतंत्रता की अनुमानित डिग्री या Satterthwaite (1946) का उपयोग करना चाहिए?
मैं वेल्च के टी-टेस्ट के लिए उपयोग करने की स्वतंत्रता की अनुमानित डिग्री के लिए सही सूत्र के रूप में उलझन में हूं। Satterthwaite's (1946) फॉर्मूला सबसे अधिक उद्धृत सूत्र है, लेकिन वेल्च ने 1947 में एक विकल्प दिया। मुझे यकीन नहीं है कि यह बेहतर है (या अधिकांश सांख्यिकीय …

3
एक निरंतर चर - अंतर की इकाई से एक खतरनाक अनुपात की व्याख्या कैसे करें?
मैं एक लेख पढ़ रहा हूं जो निरंतर चर के लिए हज़ार्ड अनुपात दिखाता है, लेकिन मुझे यकीन नहीं है कि दिए गए मूल्यों की व्याख्या कैसे करें। खतरनाक अनुपात के बारे में मेरी वर्तमान समझ यह है कि संख्या कुछ स्थिति को देखते हुए [घटना] के सापेक्ष संभावना का …

2
क्या दो-तरफ़ा एनोवा उपयुक्त है?
यह मेरे अध्ययन का विवरण है। मैं तीन पौधों के साथ प्रयोग कर रहा हूं: ए, बी, और सी। ये पौधे मधुमेह के रोगियों के लिए रक्त शर्करा को कम करने वाले हैं। मैं यह निर्धारित करना चाहता हूं कि इन तीन पौधों में से किस एक चूहों में एकल …

1
राज्य अंतरिक्ष मॉडल में कलमन फ़िल्टर की व्याख्या करना
राज्य अंतरिक्ष मॉडल में कलमन फ़िल्टर के उपयोग में क्या कदम शामिल हैं? मैंने कुछ विभिन्न योगों को देखा है , लेकिन मैं विवरणों के बारे में निश्चित नहीं हूं। उदाहरण के लिए, काउपरवेट समीकरणों के इस सेट से शुरू होता है: θटी=जीटीθटी-1+डब्ल्यूटीyt=F′tθt+vtyt=Ft′θt+vty_{t} = F^{'}_{t}\theta_{t}+v_{t} θt=Gtθt−1+wtθt=Gtθt−1+wt\theta_{t} = G_{t}\theta_{t-1}+w_{t} जहाँ पर …

2
गैर-घटक क्लस्टरिंग के लिए PyMC: गाऊसी मिश्रण के मापदंडों का अनुमान लगाने के लिए Dirichlet प्रक्रिया क्लस्टर में विफल रहती है
समस्या सेटअप पहले खिलौने की समस्याओं में से एक मैं PyMC को लागू करना चाहता था गैर-घटक क्लस्टरिंग है: कुछ डेटा दिए गए, इसे गॉसियन मिश्रण के रूप में मॉडल करें, और क्लस्टर्स की संख्या और प्रत्येक क्लस्टर के माध्य और सहसंयोजक जानें। इस विधि के बारे में जो मैं …

2
त्रुटि प्रसार एसडी बनाम एसई
मेरे पास दो अलग-अलग स्थितियों (ए और बी) में प्रति व्यक्ति एक विशेषता के 3 से 5 उपाय हैं। मैं हर हालत में प्रत्येक व्यक्ति के लिए औसत की साजिश रचने कर रहा हूँ और मैं मानक त्रुटि का उपयोग ( यानी , , साथएन= मापों की संख्या) त्रुटि सलाखों …

2
क्या यह विश्वास अंतराल की गणना करने और परिकल्पना का परीक्षण करने के लिए समझ में आता है जब पूरी आबादी का डेटा उपलब्ध है?
क्या यह विश्वास अंतराल की गणना करने और परिकल्पना का परीक्षण करने के लिए समझ में आता है जब पूरी आबादी से डेटा उपलब्ध है? मेरी राय में, इसका उत्तर नहीं है, क्योंकि हम मापदंडों के सही मूल्यों की सही गणना कर सकते हैं। लेकिन फिर, मूल आबादी से डेटा …

6
मशीन सीखने में लचीले और अनम्य मॉडल
मैं अलग-अलग परिदृश्यों के तहत लचीले मॉडल (यानी स्प्लिन) बनाम अनम्य मॉडल (जैसे रैखिक प्रतिगमन) की तुलना करने पर एक साधारण प्रश्न पर आया था। प्रश्न है: सामान्य तौर पर, क्या हम एक लचीली सांख्यिकीय शिक्षण पद्धति के प्रदर्शन की उम्मीद करते हैं जब एक अनम्य विधि की तुलना में …

1
संगति और सामान्य संभावना के लिए सामान्य सिद्धांत अधिकतम संभावना
मैं अधिकतम संभावना अनुमानकों के स्पर्शोन्मुखी गुणों से संबंधित परिणामों के लिए एक अच्छे संदर्भ में दिलचस्पी रखता हूं। एक मॉडल जहां एक आयामी घनत्व है, और किसी नमूने के आधार MLE है से जहां है "सही" का मान । मेरी दिलचस्पी दो अनियमितताएँ हैं।च n ( x | θ …

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.