सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

2
नकारात्मक मानों को लघुगणक में कैसे बदलें?
मैं जानना चाहूंगा कि नकारात्मक मूल्यों को कैसे बदलना है Log(), क्योंकि मेरे पास विषमकोणीय डेटा है। मैंने पढ़ा कि यह सूत्र के साथ काम करता है, Log(x+1)लेकिन यह मेरे डेटाबेस के साथ काम नहीं करता है और मैं परिणाम के रूप में NaN प्राप्त करना जारी रखता हूं। उदाहरण …
12 r  logarithm 

2
क्या सिक्के को दो समूहों में समूह को यादृच्छिक बनाने का एक उचित तरीका है?
इसलिए मैं और मेरे चाचा इस बात पर बहस कर रहे हैं कि क्या एक सिक्का फ्लिप वास्तव में यादृच्छिक है। मेरा तर्क है कि ऐसा नहीं है क्योंकि वास्तविक शब्दों में एक सिक्का टसर हमेशा एक सिक्के में हेरफेर करेगा इसलिए परिणाम 50/50 पर नहीं होता है इसलिए यह …

1
मुझे बेफ़िशियन मॉडल की पसंद में जेफ्रीस-लिंडले विरोधाभास के बारे में कब चिंतित होना चाहिए?
मैं अलग जटिलता के मॉडल के एक बड़े (लेकिन परिमित) स्थान पर विचार कर रहा हूं, जिसे मैं आरजेएमसीएमसी का उपयोग करके पता लगाता हूं । प्रत्येक मॉडल के लिए पैरामीटर वेक्टर पर पूर्व काफी जानकारीपूर्ण है। किन मामलों में (यदि कोई हो) मुझे जेफरीस-लिंडले विरोधाभास के बारे में चिंतित …

1
स्वचालित कीवर्ड निष्कर्षण: सुविधाओं के रूप में कोसाइन समानताओं का उपयोग करना
मुझे एक दस्तावेज़-टर्म मैट्रिक्स , और अब मैं एक पर्यवेक्षित शिक्षण पद्धति (SVM, Naive Bayes, ...) के साथ प्रत्येक दस्तावेज़ के लिए कीवर्ड निकालना चाहूंगा। इस मॉडल में, मैं पहले से ही Tf-idf, Pos टैग, ...ममM लेकिन अब मैं nexts के बारे में सोच रहा हूं। मुझे शर्तों के बीच …

1
घनत्व प्लॉट की ऊंचाई की व्याख्या कैसे करें
मुझे घनत्व प्लॉट की ऊंचाई की व्याख्या कैसे करनी चाहिए: उपरोक्त भूखंड में उदाहरण के लिए, शिखर x = 18 पर लगभग 0.07 पर है। क्या मैं अनुमान लगा सकता हूं कि लगभग 7% मूल्य 18 के आसपास हैं? क्या मैं इससे अधिक विशिष्ट हो सकता हूं? 0.02 की ऊंचाई …

2
शब्दों के बजाय टेक्स्ट भाषा की पहचान में n-gram का उपयोग क्यों किया जाता है?
दो लोकप्रिय भाषा पहचान पुस्तकालयों में, सी ++ के लिए कॉम्पैक्ट भाषा डिटेक्टर 2 और जावा के लिए भाषा डिटेक्टर , दोनों ने पाठ विशेषताओं को निकालने के लिए (चरित्र आधारित) एन-ग्राम का इस्तेमाल किया। बैग-ऑफ-वर्ड्स (एकल शब्द / शब्दकोश) का उपयोग क्यों नहीं किया जाता है, और बैग-ऑफ-वर्ड्स और …

1
एन सामान्य आईआईडी के उत्पाद का अनुमानित वितरण? विशेष मामला μ≈0
यह देखते हुए आईआईडी , और , की तलाश में:N≥30N≥30N\geq30Xn≈N(μX,σ2X)Xn≈N(μX,σX2)X_n\approx\mathcal{N}(\mu_X,\sigma_X^2)μX≈0μX≈0\mu_X \approx 0 सटीक बंद फ़ॉर्म वितरण सन्निकटन YN=∏1NXnYN=∏1NXnY_N=\prod\limits_{1}^{N}{X_n} असममित ( घातांक ?) एक ही उत्पाद का सन्निकटन यह अधिक सामान्य प्रश्न का एक विशेष केस है ।μX≈0μX≈0\mu_X \approx 0

1
कोहेन के स्टेटिस्टिक का भिन्न
कोहेन की सबसे आम तरीकों में से एक है जिसे हम एक प्रभाव के आकार को मापते हैं ( देखें विकिपीडिया )। यह केवल मानक मानक विचलन के संदर्भ में दो साधनों के बीच की दूरी को मापता है। हम कोहेन के अनुमान के गणितीय सूत्र को कैसे प्राप्त कर …

2
बायेसियन न्यूरल नेटवर्क का उपयोग करने के क्या फायदे हैं
हाल ही में मैंने बायेसियन न्यूरल नेटवर्क (बीएनएन) [नील, 1992] , [नील, 2012] के बारे में कुछ पेपर पढ़े , जो तंत्रिका नेटवर्क में इनपुट और आउटपुट के बीच संभाव्यता संबंध देता है। इस तरह के एक तंत्रिका नेटवर्क का प्रशिक्षण MCMC के माध्यम से होता है जो पारंपरिक बैक-प्रचार …

3
बूस्टिंग विधि आउटलेर्स के लिए संवेदनशील क्यों है
मुझे कई लेख मिले जो बताते हैं कि बढ़ावा देने के तरीके बाहरी लोगों के लिए संवेदनशील हैं, लेकिन कोई भी लेख क्यों नहीं समझा रहा है। मेरे अनुभव में किसी भी मशीन लर्निंग एल्गोरिदम के लिए आउटलेयर खराब हैं, लेकिन विशेष रूप से संवेदनशील के रूप में एकल को …

2
फिशर मानदंड वजन की गणना कैसे करें?
मैं पैटर्न मान्यता और मशीन सीखने का अध्ययन कर रहा हूं, और मैं निम्नलिखित प्रश्न में भाग गया। समान श्रेणी के समान प्रायिकता साथ दो-स्तरीय वर्गीकरण समस्या पर विचार करेंP(D1)=P(D2)=12P(D1)=P(D2)=12P(D_1)=P(D_2)= \frac{1}{2} और द्वारा दिए गए प्रत्येक वर्गों में उदाहरणों का वितरण p(x|D1)=N([00],[2001]),p(x|D1)=N([00],[2001]), p(x|D_1)= {\cal N} \left( \begin{bmatrix} 0 \\0 \end{bmatrix}, …

3
दो डेटा सेट के बीच समानता की मात्रा
सारांश : एक एकल मान का उपयोग करके डेटा के दो संरेखित डेटा सेटों के बीच समानता को सारांशित करने के लिए सबसे अच्छा तरीका खोजने की कोशिश करना। विवरण : मेरा प्रश्न एक आरेख के साथ सबसे अच्छा समझाया गया है। नीचे दिए गए ग्राफ़ दो अलग-अलग डेटा सेट …

1
घनत्व अनुमान विधि का नाम क्या है जहां एक सामान्य मिश्रण वितरण बनाने के लिए सभी संभव जोड़े का उपयोग किया जाता है?
मैंने केवल एक आयामी घनत्व अनुमान बनाने का एक साफ (जरूरी नहीं कि अच्छा) तरीका सोचा है और मेरा सवाल है: क्या इस घनत्व आकलन विधि का कोई नाम है? यदि नहीं, तो क्या यह साहित्य में किसी अन्य पद्धति का विशेष मामला है? यहाँ विधि है: हमारे पास एक …

3
संभाव्यता में अभिसरण के संबंध में
चलो यादृच्छिक परिवर्तनीय सेंट का एक अनुक्रम होना संभावना है, जहां में एक निश्चित स्थिर है। मैं निम्नलिखित दिखाने की कोशिश कर रहा हूँ: और दोनों को प्रायिकता में। मैं यह देखने के लिए यहाँ हूँ कि क्या मेरा तर्क ध्वनि था। यहाँ मेरा काम है{ एक्सn}n ≥ 1{Xn}n≥1\{X_n\}_{n\geq 1}एक्सn→ …

2
क्या एक आत्मविश्वास अंतराल वास्तव में एक पैरामीटर अनुमान की अनिश्चितता का एक उपाय प्रदान करता है?
मैं सांख्यिकीविद विलियम ब्रिग्स द्वारा एक ब्लॉग पोस्ट पढ़ रहा था, और निम्नलिखित दावे ने मुझे कम से कम कहने के लिए दिलचस्पी दिखाई। इससे क्या बनाया जाता है? एक विश्वास अंतराल क्या है? यह एक समीकरण है, निश्चित रूप से, यह आपको आपके डेटा के लिए एक अंतराल प्रदान …

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.