सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

2
रैखिक प्रतिगमन में छात्र या सामान्य वितरण का उपयोग कब करें?
मैं कुछ समस्याओं को देख रहा हूं, और कुछ में, गुणांक का परीक्षण करने के लिए, कभी-कभी मैं छात्रों को वितरण का उपयोग करते हुए देखता हूं, और कभी-कभी मैं सामान्य वितरण देखता हूं। नियम क्या है?

6
R- वर्ग की तुलना दो अलग-अलग रैंडम फ़ॉरेस्ट मॉडल से करें
मैं नमूनों की तुलना में अधिक भविष्यवक्ताओं के साथ "विस्तृत" डेटासेट में निरंतर परिणाम की व्याख्या करने की कोशिश करने के लिए एक यादृच्छिक वन मॉडल विकसित करने के लिए आर में यादृच्छिकतम पैकेज का उपयोग कर रहा हूं। विशेष रूप से, मैं एक आरएफ मॉडल फिटिंग कर रहा हूं, …

3
एक घटना की संभावना जो औसत दर्जे का नहीं है
हम माप सिद्धांत से जानते हैं कि ऐसी घटनाएं हैं जो मापी नहीं जा सकती हैं, अर्थात वे लेब्सगेग मापने योग्य नहीं हैं। किसी घटना को हम किस संभावना के साथ कहते हैं कि प्रायिकता माप को परिभाषित नहीं किया जाता है? इस तरह की घटना के बारे में हम …

3
सहसंबंध मैट्रिक्स में एक सहसंबंध के सांख्यिकीय महत्व को इंगित करने के लिए सहसंबंध गुणांक के लिए थ्रेसहोल्ड
मैंने डेटा सेट के सहसंबंध मैट्रिक्स की गणना की है जिसमें 455 डेटा बिंदु हैं, प्रत्येक डेटा बिंदु जिसमें 14 विशेषताओं हैं। तो सहसंबंध मैट्रिक्स का आयाम 14 x 14 है। मैं सोच रहा था कि क्या सहसंबंध गुणांक के मूल्य के लिए एक सीमा है जो बताता है कि …

1
क्या सांख्यिकीय मॉडल के प्रशिक्षण के लिए "पर्याप्त" डेटा की अवधारणा है?
मैं बहुत से सांख्यिकीय मॉडलिंग पर काम करता हूं, जैसे कि हिडन मार्कोव मॉडल और गौसियन मिक्सचर मॉडल। मैं देखता हूं कि इन मामलों में से प्रत्येक में अच्छे मॉडल को प्रशिक्षित करने के लिए एक बड़े (> एचएमएम के लिए 20000 वाक्य) डेटा की आवश्यकता होती है जो अंतिम …

2
क्या एक मॉडल फिट स्टेटिस्टिक (एआईसी या बीआईसी की तरह) मौजूद है जो सिर्फ सापेक्ष तुलना के बजाय निरपेक्ष के लिए इस्तेमाल किया जा सकता है?
मैं इस साहित्य से परिचित नहीं हूँ, इसलिए यदि यह एक स्पष्ट प्रश्न है तो कृपया मुझे क्षमा करें। चूंकि एआईसी और बीआईसी संभावना को अधिकतम करने पर निर्भर करते हैं, ऐसा लगता है कि उनका उपयोग केवल किसी दिए गए डेटा-सेट को फिट करने के प्रयास के मॉडल के …

3
डेटा बिंदुओं के औसत से दो समय-श्रृंखला का संयोजन
मैं मीन स्क्वेरेड प्रीडिक्शन एरर को कम करके एक टाइम-सीरीज़ में सेट किए गए टाइम-सीरीज़ डेटा के पूर्वानुमानित और बैककास्टेड (अर्थात पिछले मूल्यों की भविष्यवाणी) को संयोजित करना चाहूंगा। कहो कि मेरे पास 2001-2010 से वर्ष 2007 के अंतराल के साथ समय श्रृंखला है। मैं 2001-2007 डेटा (लाल रेखा - …

1
फ़ंक्शन के आकार को बनाए रखते हुए किसी फ़ंक्शन को संभाव्यता घनत्व में कैसे बदल दिया जाए?
मेरे पास कार्यों की एक श्रृंखला है, प्रत्येक एक माना जाता है जो एजेंटों के बीच एक यादृच्छिक चर के घनत्व का प्रतिनिधित्व करता है। प्रत्येक फ़ंक्शन में एक डोमेन भी होता है, जो बताता है कि यादृच्छिक चर के कौन से मूल्य मान्य हैं। अब, अगर मुझे अपने आँकड़े …

2
एम-अनुमानक के लिए सही मायनों में अभिसरण करने की शर्तें
एक गाऊसी वितरण और M-अनुमानक, से iid नमूने दिए। , पर कौन से गुण संभावना में गारंटी देने के लिए पर्याप्त हैं ? क्या सख्ती से उत्तल हो रहा है और सख्ती से पर्याप्त बढ़ रहा है?X1,...,Xn∼N(μ,σ)X1,...,Xn∼N(μ,σ)X_1,...,X_n \sim N(\mu,\sigma) μm=argmina∑ρ(|Xi−a|)μm=argmina∑ρ(|Xi−a|)\mu_m = \underset{a}{\operatorname{argmin}} \sum\rho(|X_i-a|)ρρ\rhoμm→μμm→μ\mu_m \rightarrow \muρρ\rho
10 estimation 

5
2-अक्षर संयोजन की कल्पना करना
SO पर इस प्रश्न के उत्तर ने लगभग 125 एक- दो अक्षरों के नामों का एक सेट लौटाया: /programming/6979630/what-1-2-letter-object-names-conflict-with-existing -r वस्तुओं [1] "Ad" "am" "ar" "as" "bc" "bd" "bp" "br" "BR" "bs" "by" "c" "C" [14] "cc" "cd" "ch" "ci" "CJ" "ck" "Cl" "cm" "cn" "cq" "cs" "Cs" "cv" [27] …

4
ऑनलाइन बाहरी पहचान
मैं उच्च-थ्रूपुट इमेजिंग पाइपलाइन के एक भाग के रूप में दोषपूर्ण छवियों और / या दोषपूर्ण विभाजन का पता लगाने के लिए स्वचालित रूप से खंडित माइक्रोस्कोपी छवियों को संसाधित करना चाहता हूं। मापदंडों की एक मेजबान है जो प्रत्येक कच्ची छवि और विभाजन के लिए गणना की जा सकती …
10 outliers  online 

1
क्या मिश्रित मॉडल में भविष्यवक्ता के रूप में समय को शामिल करने की अनुमति है?
मैं हमेशा यह मानता था कि समय का उपयोग प्रतिगामियों (incl। Gam) के भविष्यवक्ता के रूप में नहीं किया जाना चाहिए क्योंकि, तब, एक ही प्रवृत्ति का "वर्णन" करेगा। यदि एक अध्ययन का उद्देश्य तापमान आदि जैसे पर्यावरणीय मापदंडों को खोजना है, जो किसी जानवर की गतिविधि को स्पष्ट करते …

2
समय श्रृंखला सेट की तुलना
मेरे पास समय-श्रृंखला डेटा के तीन सेट हैं जिनकी मैं तुलना करना चाहता हूं। उन्हें लगभग 12 दिनों के 3 अलग-अलग समय पर लिया गया है। वे फाइनल हफ़्ते के दौरान एक कॉलेज की लाइब्रेरी में लिए गए हेड काउंट्स का औसत, अधिकतम और न्यूनतम हैं। मुझे औसत, अधिकतम और …

4
जनसांख्यिकी प्रति 100,000 लोगों को दर क्यों देते हैं?
यह सार्वभौमिक लगता है कि प्रति वर्ष 100,000 जनसंख्या के संदर्भ में जनसांख्यिकीय आंकड़े दिए जाते हैं। उदाहरण के लिए, आत्महत्या की दर, हत्या की दर, विकलांगता-समायोजित जीवन वर्ष, सूची चलती है। क्यों? अगर हम रसायन विज्ञान के बारे में बात कर रहे हैं, तो प्रति मिलियन (पीपीएम) भाग आम …
10 demography  units 

2
क्या दो डेटासेट के लिए फिट परीक्षण का एंडरसन-डार्लिंग अच्छाई है?
मुझे पता है कि ad.test () का उपयोग सामान्यता के परीक्षण के लिए किया जा सकता है। क्या दो डेटा नमूनों से वितरण की तुलना करने के लिए ad.test प्राप्त करना संभव है? x <- rnorm(1000) y <- rgev(2000) ad.test(x,y) मैं 2 नमूनों पर एंडरसन-डार्लिंग परीक्षण कैसे कर सकता हूं?

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.