सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

4
एन बराबर समूहों में डेटा विभाजित करें
मेरे पास एक डेटाफ्रेम है जिसमें 4 कॉलम के मान हैं: उदाहरण के लिए: ID, price, click count,rating मैं क्या करना चाहूंगा इस डेटाफ्रेम को एन अलग-अलग समूहों में "विभाजित" करना है जहां प्रत्येक समूह में समान वितरण मूल्य के साथ पंक्तियों की समान संख्या होगी, गिनती और रेटिंग विशेषताओं …
11 r  distributions 

1
कैसे कर सकते हैं मैं गणना
बंद फॉर्म में सामान्य सीडीएफ के वर्ग की अपेक्षा का मूल्यांकन कैसे किया जा सकता है? ई [ Φ ( एक Z+ बी )2] = ∫∞- ∞Φ ( एक z+ बी )2ϕ ( z))घzE[Φ(aZ+b)2]=∫−∞∞Φ(az+b)2ϕ(z)dz\mathbb{E}\left[\Phi\left(aZ+b\right)^{2}\right] = \int_{-\infty}^{\infty}\Phi\left(az+b\right)^{2}\phi(z)\,dz यहां, , वास्तविक संख्या हैं, , और और एक सामान्य सामान्य यादृच्छिक चर के …

2
शब्दों के निरंतर थैले के बारे में प्रश्न
मुझे इस वाक्य को समझने में परेशानी हो रही है: पहला प्रस्तावित आर्किटेक्चर फीडफोर्वर्ड एनएनएलएम के समान है, जहां गैर-लीनियर छिपी हुई परत को हटा दिया जाता है और सभी शब्दों के लिए प्रोजेक्शन लेयर को साझा किया जाता है (न केवल प्रोजेक्शन मैट्रिक्स); इस प्रकार, सभी शब्द एक ही …

3
समायोज्य परिशुद्धता बनाम याद के साथ वर्गीकरण
मैं एक द्विआधारी वर्गीकरण समस्या पर काम कर रहा हूं जहां झूठी सकारात्मकता न होना बहुत महत्वपूर्ण है; बहुत सारे झूठे नकारात्मक हैं ठीक है। मैंने उदाहरण के लिए स्केलेर में क्लासिफायर का एक गुच्छा इस्तेमाल किया है, लेकिन मुझे लगता है कि उनमें से कोई भी सटीक-रिकॉल ट्रेडऑफ को …

2
हमें एक समय श्रृंखला से सीज़न को क्यों निकालना चाहिए?
समय श्रृंखला के साथ काम करते हुए, हम कभी-कभी वर्णक्रमीय विश्लेषण का उपयोग करके मौसम का पता लगाते हैं और हटाते हैं। मैं समय श्रृंखला में एक वास्तविक शुरुआत कर रहा हूं, और मैं उलझन में हूं कि कोई मूल समय श्रृंखला से मौसमी को क्यों निकालना चाहेगा? मौसमी हटाने …

2
फिशर का सटीक परीक्षण क्या वितरण मानता है?
अपने काम में मैंने फिशर के सटीक परीक्षण के कई उपयोग देखे हैं, और मैं सोच रहा था कि यह मेरे डेटा को कितनी अच्छी तरह फिट करता है। कई स्रोतों को देखते हुए मैं समझ गया कि सांख्यिकीय की गणना कैसे करें, लेकिन कभी-कभी अनुमानित शून्य परिकल्पना की स्पष्ट …

2
Adaboost निर्णय पेड़ों के साथ क्यों?
मैं विशेष रूप से वर्गीकरण कार्यों और विशेष रूप से Adaboost के लिए एल्गोरिदम को बढ़ावा देने पर थोड़ा पढ़ रहा हूं। मैं समझता हूं कि Adaboost का उद्देश्य कई "कमजोर शिक्षार्थियों" को लेना है, और प्रशिक्षण डेटा पर पुनरावृत्तियों के सेट के माध्यम से, कक्षाओं का अनुमान लगाने के …

2
दृढ़ संकल्प काम क्यों करता है?
इसलिए मुझे पता है कि अगर हम स्वतंत्र यादृच्छिक चर की राशि का प्रायिकता वितरण ढूंढना चाहते हैं , तो हम यह कहकर और के प्रायिकता वितरण से गणना कर सकते हैंएक्स वाईX+YX+YX + YXXXYYY fX+Y(a)=∫∞x=−∞fX,Y(X=x,Y=a−x) dx=∫∞x=−∞fX(x)fY(a−x) dxfX+Y(a)=∫x=−∞∞fX,Y(X=x,Y=a−x) dx=∫x=−∞∞fX(x)fY(a−x) dxf_{X + Y}(a) = \int_{x = -\infty}^{\infty} f_{X, Y}(X = x, …

1
छद्म-यादृच्छिक संख्या पीढ़ी में बीज स्थापित करने के लिए संदर्भ और सर्वोत्तम अभ्यास
में इस दस्तावेज़ , कि चिंताओं "सेट बीज" कमांड, Stata लोगों बीज जब छद्म यादृच्छिक संख्या पैदा करने की सेटिंग से संबंधित मुद्दों पर चर्चा। एक उल्लेखनीय "नहीं" है "क्रमिक रूप से बीज के रूप में प्राकृतिक संख्याओं के अनुक्रम का उपयोग न करें, क्योंकि इसमें एक पैटर्न और खतरे …

2
लॉग-ऑड वितरण क्या है?
मैं मशीन लर्निंग पर एक पाठ्यपुस्तक पढ़ रहा हूं (डेटा खनन द्वारा लिखित, एट अल।, 2011) और इस मार्ग पर आया: ... इसके अलावा, विभिन्न वितरणों का उपयोग किया जा सकता है। यद्यपि सामान्य वितरण आमतौर पर संख्यात्मक विशेषताओं के लिए एक अच्छा विकल्प है, यह उन विशेषताओं के लिए …

2
यदि एक टाइम सीरीज़ दूसरी ऑर्डर स्टेशनरी है, तो क्या इसका मतलब यह सख्ती से स्थिर है?
एक प्रक्रिया सख्ती से स्थिर है अगर के संयुक्त वितरण के संयुक्त वितरण रूप में ही है सभी m के लिए , सभी k के लिए और सभी t_1, t_2, ..., t_m के लिए ।XtXtX_tXt1,Xt2,...,XtmXt1,Xt2,...,XtmX_{t_1},X_{t_2},...,X_{t_m}Xt1+k,Xt2+k,...,Xtm+kXt1+k,Xt2+k,...,Xtm+kX_{t_1+k},X_{t_2+k},...,X_{t_m+k}mmmkkkt1,t2,...,tmt1,t2,...,tmt_1,t_2,...,t_m एक प्रक्रिया द्वितीय क्रम स्थिर है यदि इसका माध्य स्थिर है और इसका आटोक्लेवेरियन कार्य …

2
रैखिक प्रतिगमन में द्विआधारी / द्विस्वभाव स्वतंत्र भविष्यवक्ताओं के लिए अवशिष्ट विश्लेषण कैसे करें?
मैं प्रबंधित फंड पर रिटर्न की भविष्यवाणी करने के लिए आर में नीचे कई रैखिक प्रतिगमन प्रदर्शन कर रहा हूं। reg <- lm(formula=RET~GRI+SAT+MBA+AGE+TEN, data=rawdata) यहां केवल जीआरआई और एमबीए द्विआधारी / द्विध्रुवीय भविष्यवक्ता हैं; शेष भविष्यवक्ता निरंतर हैं। मैं बाइनरी चर के लिए अवशिष्ट भूखंडों को उत्पन्न करने के लिए …

3
सटीक-रिकॉल वक्र के लिए एक अच्छा AUC क्या है?
क्योंकि मेरे पास बहुत असंतुलित डेटासेट (9% सकारात्मक परिणाम) हैं, मैंने फैसला किया कि एक सटीक-रिकॉल वक्र ROC वक्र की तुलना में अधिक उपयुक्त था। मैंने पीआर वक्र (.49, यदि आप रुचि रखते हैं) के तहत क्षेत्र का अनुरूप सारांश माप प्राप्त किया, लेकिन इसकी व्याख्या कैसे करें, इसके बारे …

2
एमसीएमसी में कम ऑटो-सहसंबंध होना क्यों वांछनीय है?
मैं MCMC में स्वत :संबंध की जाँच करने की आवश्यकता के बारे में पढ़ता रहता हूँ। यह क्यों महत्वपूर्ण है कि ऑटोक्रेलेशन कम है? यह MCMC के संदर्भ में क्या मापता है?

2
क्या वैकल्पिक परिकल्पना को स्वीकार करना संभव है?
मैं यहाँ कई संबंधित प्रश्नों से अवगत हूँ (उदाहरण के लिए, अशक्तता के आस-पास की परिकल्पना परीक्षण शब्दावली , क्या यह एक परिकल्पना सिद्ध करना संभव है? ) लेकिन मुझे नीचे दिए गए मेरे प्रश्न का निश्चित उत्तर नहीं पता है। मान लीजिए कि एक परिकल्पना परीक्षण है जहां हम …

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.