सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

2
पी-मूल्य की दो परिभाषाएँ: उनकी समानता कैसे साबित करें?
मैं लैरी वासरमैन की पुस्तक, ऑल स्टैटिस्टिक्स और वर्तमान में पी-वैल्यूज़ (पृष्ठ 187) के बारे में पढ़ रहा हूं । मुझे पहले कुछ परिभाषाएँ (मैं बोली): परिभाषा 1 अस्वीकृति क्षेत्र के साथ एक परीक्षण की शक्ति समारोह द्वारा परिभाषित किया गया है एक परीक्षण के आकार होने के लिए परिभाषित …

1
गैर-पैरामीट्रिक बूटस्ट्रैप पी-मान बनाम आत्मविश्वास अंतराल
प्रसंग यह कुछ हद तक इस प्रश्न के समान है , लेकिन मुझे नहीं लगता कि यह एक सटीक डुप्लिकेट है। जब आप यह देखते हैं कि बूटस्ट्रैप परिकल्पना परीक्षण करने के लिए कैसे निर्देश हैं, तो आमतौर पर यह कहा जाता है कि आत्मविश्वास अंतराल के लिए अनुभवजन्य वितरण …

1
पहले k (अनुभवजन्य) क्षणों का उपयोग करके एक अनुमानित पीडीएफ (यानी: घनत्व का अनुमान) कैसे फिट किया जाए?
मेरे पास एक ऐसी स्थिति है जहां मैं डेटा-सेट के (पहले) क्षणों का अनुमान लगाने में सक्षम हूं , और घनत्व फ़ंक्शन के अनुमान का उत्पादन करने के लिए इसका उपयोग करना चाहूंगा।ककk मैं पहले से ही पियर्सन वितरण में आया था , लेकिन यह महसूस किया कि यह केवल …

1
प्रदर्शन के संदर्भ में शब्द एम्बेडिंग एल्गोरिदम
मैं एक वेक्टर अंतरिक्ष में लगभग 60 मिलियन वाक्यांशों को एम्बेड करने की कोशिश कर रहा हूं , फिर उनके बीच कॉशन समानता की गणना करें। मैं sklearn का उपयोग कर रहा हूँ CountVectorizerएक कस्टम निर्मित tokenizer फ़ंक्शन जो unigrams और bigrams का उत्पादन करता है। यह बताता है कि …

1
वर्गीकरण कार्यों के लिए फीचर चयन महत्वपूर्ण क्यों है?
मैं फीचर चयन के बारे में सीख रहा हूं। मैं देख सकता हूं कि मॉडल निर्माण के लिए यह महत्वपूर्ण और उपयोगी क्यों होगा। लेकिन आइए पर्यवेक्षित शिक्षण (वर्गीकरण) कार्यों पर ध्यान दें। वर्गीकरण कार्यों के लिए फीचर चयन महत्वपूर्ण क्यों है? मैं देख रहा हूँ कि बहुत सारे साहित्य …

2
आंशिक रूप से "अज्ञात" डेटा के साथ वर्गीकरण
मान लीजिए मैं एक क्लासिफायरियर सीखना चाहता हूं जो इनपुट के रूप में संख्याओं का वेक्टर लेता है, और आउटपुट के रूप में एक क्लास लेबल देता है। मेरे प्रशिक्षण डेटा में बड़ी संख्या में इनपुट-आउटपुट जोड़े हैं। हालाँकि, जब मैं कुछ नए डेटा पर परीक्षण करने आता हूं, तो …

3
संपार्श्विकता का पता लगाने के लिए विभिन्न दृष्टिकोणों के गुण क्या हैं?
मैं यह पता लगाना चाहता हूं कि क्या मेरे ओएलएस रिग्रेशन में कोलिनियरिटी एक समस्या है। मैं समझता हूं कि प्रसरण मुद्रास्फीति कारक और स्थिति सूचकांक दो आमतौर पर उपयोग किए जाने वाले उपाय हैं, लेकिन प्रत्येक दृष्टिकोण के गुणों या स्कोर क्या होना चाहिए, इसके बारे में कुछ भी …

1
भौगोलिक निर्देशांक से कर्नेल घनत्व अनुमान की गणना का उचित तरीका क्या है?
मुझे अक्षांश और देशांतर निर्देशांक की सूची से 2d कर्नेल घनत्व अनुमान (kde) की गणना करनी है। लेकिन अक्षांश में एक डिग्री देशांतर में एक डिग्री के समान दूरी नहीं है, इसका मतलब है कि व्यक्तिगत गुठली अंडाकार होगी, विशेष रूप से बिंदु भूमध्य रेखा से है। मेरे मामले में …

1
संभावना अनुपात परीक्षण के '' वांछनीय '' सांख्यिकीय गुण क्या हैं?
मैं एक लेख पढ़ रहा हूं, जिसकी विधि पूरी तरह से संभावना अनुपात परीक्षण पर आधारित है। लेखक का कहना है कि एक तरफा विकल्पों के खिलाफ एलआर परीक्षण यूएमपी है। वह दावा करके आगे बढ़ता है "... यहां तक ​​कि जब यह [LR परीक्षण] को समान रूप से सबसे …

2
गाऊसी प्रक्रिया में टिप्पणियों का विलय
मैं प्रतिगमन के लिए गॉसियन प्रक्रिया (जीपी) का उपयोग कर रहा हूं। मेरी समस्या में यह दो या अधिक डेटा बिंदुओं के लिए काफी सामान्य है एक दूसरे के करीब होने के लिए, अपेक्षाकृत लंबाई के लिए समस्या का पैमाना। इसके अलावा, अवलोकन अत्यधिक शोर हो सकता है। कम्प्यूटेशन में …

1
क्या सांख्यिकीविद् वास्तविक लागू कार्यों में जेफ्रीज़ के पूर्व का उपयोग करते हैं?
जब मैंने अपने स्नातक सांख्यिकीय अनुमान कक्षा में जेफ्रीज़ के बारे में सीखा तो मेरे प्रोफेसरों ने इसे ध्वनि की तरह बना दिया, क्योंकि यह ज्यादातर ऐतिहासिक कारणों के बजाय दिलचस्प था क्योंकि कोई भी कभी भी इसका उपयोग करेगा। फिर जब मैंने बायेसियन डेटा विश्लेषण लिया, तो हमें कभी …

2
एमएपी का उपयोग करते हुए एक पैरामीटर का आकलन करते समय एमसीएमसी की आवश्यकता क्यों होती है
एक पैरामीटर के एमएपी आकलन के लिए सूत्र को देखते हुए एमसीएमसी (या समान) दृष्टिकोण की आवश्यकता क्यों है, क्या मैं सिर्फ व्युत्पन्न नहीं ले सकता, इसे शून्य पर सेट कर सकता हूं और फिर पैरामीटर के लिए हल कर सकता हूं?

4
कैसे चुनें कि क्या बस कतार को छोड़ दें या संभावना सिद्धांत का उपयोग करके वहां रहें?
मैं पिछले कुछ समय से कुछ सोच रहा हूं, और चूंकि मैं प्रायिकता सिद्धांत में बहुत कुशल नहीं हूं, इसलिए मुझे लगा कि यह सवाल पूछने के लिए यह एक अच्छी जगह हो सकती है। यह कुछ ऐसा है जो सार्वजनिक परिवहन की लंबी कतारों में मेरे ऊपर आया। मान …

1
यदि जनसंख्या का मतलब ज्ञात हो तो जनसंख्या का अनुमानित रूपांतर
मुझे पता है कि हम 1 का उपयोग करते हैंएक जनसंख्या का विचरण अनुमान लगाने के लिए। मैं खान अकादमी से एक वीडियो याद जहां अंतर्ज्ञान दिया था कि हमारे अनुमान के अनुसार मतलब शायद वास्तविक एक बंद एक सा तो दूरी हैxमैं- ˉ एक्स वास्तव में अधिक से अधिक …
11 variance  sample 

2
परिवार-वार त्रुटि सीमा: क्या स्वतंत्र प्रश्नों के विभिन्न अध्ययनों पर डेटा सेटों का पुन: उपयोग करने से कई परीक्षण समस्याएं होती हैं?
यदि शोधकर्ताओं का एक दल किसी दिए गए डेटा सेट पर कई (परिकल्पना) परीक्षण करता है, तो इस बात पर जोर दिया जाता है कि कई परीक्षण (बोनफेरोनी, इत्यादि) के लिए कुछ सुधार का उपयोग करना चाहिए, भले ही परीक्षण स्वतंत्र हों। मेरा सवाल यह है: क्या यह एक ही …

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.