सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

1
लॉजिस्टिक लॉस फंक्शन के लिए ग्रेडिएंट
मैं इस एक से संबंधित एक प्रश्न पूछूंगा । मुझे यहाँ xgboost के लिए कस्टम लॉस फंक्शन लिखने का एक उदाहरण मिला : loglossobj <- function(preds, dtrain) { # dtrain is the internal format of the training data # We extract the labels from the training data labels <- getinfo(dtrain, …

2
क्या एक राशि और दो सहसंयोजक मैट्रिक्स का एक उत्पाद भी एक सहसंयोजक मैट्रिक्स है?
मान लीजिए कि मेरे पास कोवरियस मैट्रिस और । इन विकल्पों में से कौन सा तब भी सहसंयोजक मैट्रिक्स हैं?XXXYYY X+YX+YX+Y X2X2X^2 XYXYXY मुझे यह समझने में थोड़ी परेशानी होती है कि एक कोविरेस मैट्रिक्स होने के लिए वास्तव में किसी चीज़ की क्या आवश्यकता है। मुझे लगता है कि …

1
विषमतापूर्ण निष्पक्षता और संगति के बीच अंतर क्या है?
क्या प्रत्येक दूसरे को प्रभावित करता है? यदि नहीं, तो क्या एक दूसरे को प्रभावित करता है? क्यों नहीं? मेरे द्वारा यहां पोस्ट किए गए उत्तर पर एक टिप्पणी के जवाब में यह मुद्दा सामने आया । हालाँकि Google ने प्रासंगिक शब्दों को खोजते हुए कुछ भी उत्पन्न नहीं किया …

1
केंद्रीय सीमा प्रमेय एक नमूने के साथ क्यों काम करता है?
मुझे हमेशा सिखाया गया है कि सीएलटी काम करता है जब आपने नमूना दोहराया है, प्रत्येक नमूना काफी बड़ा है। उदाहरण के लिए, कल्पना कीजिए कि मेरे पास 1,000,000 नागरिकों का देश है। सीएलटी के बारे में मेरी समझ यह है कि भले ही उनकी ऊंचाइयों का वितरण सामान्य नहीं …

3
तिरछे डेटा के साथ प्रतिगमन
जनसांख्यिकी और सेवा से यात्रा की गणना करने की कोशिश कर रहा है। डेटा बहुत तिरछा है। हिस्टोग्राम: qq भूखंड (बाएं लॉग है): m <- lm(d$Visits~d$Age+d$Gender+city+service) m <- lm(log(d$Visits)~d$Age+d$Gender+city+service) cityऔर serviceकारक चर हैं। मुझे सभी चर के लिए कम p मान मिलता है, लेकिन मुझे .05 का निम्न r-squared भी …

1
क्यों बाईं-तिरछी को नकारात्मक रूप से तिरछी कहा जाता है और दाईं-तिरछी को सकारात्मक तिरछा कहा जाता है?
मैं नामकरण के बारे में उत्सुक हूं: क्यों बाईं-तिरछी को नकारात्मक रूप से तिरछा और दाहिने-तिरछा कहा जाता है जिसे सकारात्मक रूप से तिरछा कहा जाता है?

1
नेटवर्क मेटा-विश्लेषण के लिए सबसे अच्छी विधि कौन सी है?
नेटवर्क मेटा-विश्लेषण या मिश्रित उपचार तुलना करने के लिए अब कई अलग-अलग दृष्टिकोण हैं। सबसे अधिक इस्तेमाल किया और सुलभ वाले शायद निम्नलिखित हैं: एक बायेशियन ढांचे में : WinBUGS (जैसे जैक्सन एट अल ) में डिज़ाइन-बाय-ट्रीटमेंट इंटरैक्शन दृष्टिकोण ; WinBUGS (जैसे झाओ एट अल ) में पदानुक्रमित हाथ आधारित …

3
तंत्रिका नेटवर्क के लिए दिनांक / समय (चक्रीय डेटा) एन्कोडिंग
एक तंत्रिका नेटवर्क के लिए एक घटना की तारीख और समय को कैसे सांकेतिक शब्दों में बदलना है? मेरे पास निरंतर समय श्रृंखला नहीं है, लेकिन तारीख और समय के साथ कुछ घटनाएं हैं, और मैं किसी तरह की रुचि का विश्लेषण करता हूं। यह रुचि सुबह और शाम के …

2
निर्णय पेड़ और प्रतिगमन - क्या अनुमानित मूल्यों को प्रशिक्षण डेटा के बाहर सीमा हो सकती है?
जब पेड़ों पर निर्णय लेने की बात आती है, तो क्या अनुमानित मूल्य प्रशिक्षण डेटा की सीमा के बाहर हो सकता है? उदाहरण के लिए, यदि प्रशिक्षण डेटा लक्ष्य श्रेणी की रेंज 0-100 है, जब मैं अपना मॉडल तैयार करता हूं और इसे किसी और चीज पर लागू करता हूं, …

2
क्या बायोसियन तरीके स्वाभाविक रूप से अनुक्रमिक हैं?
अर्थात्, क्रमिक विश्लेषण करने के लिए (आप समय से पहले नहीं जानते कि आप वास्तव में कितना डेटा एकत्र करेंगे) लगातार तरीकों के साथ विशेष देखभाल की आवश्यकता होती है; जब तक पी-मान पर्याप्त रूप से छोटा नहीं हो जाता है या आत्मविश्वास अंतराल पर्याप्त रूप से छोटा नहीं हो …

5
गैर-आवधिक समय श्रृंखला में प्रवृत्ति का विश्लेषण कैसे करें
मान लीजिए कि मेरे पास गैर-आवधिक समय श्रृंखला है। जाहिर है रुझान कम हो रहा है और मैं इसे कुछ परीक्षण ( पी-वैल्यू के साथ ) साबित करना चाहूंगा । मैं मूल्यों के बीच मजबूत अस्थायी (धारावाहिक) ऑटो-सहसंबंध के कारण क्लासिक रैखिक प्रतिगमन का उपयोग करने में असमर्थ हूं। library(forecast) …
12 r  time-series 

2
Dep दीक्षांत समारोह के साथ गहराई में जाना ’में डेप्थोंकैट का संचालन कैसे होता है?
पठन संकल्पों के साथ गहराई से आगे बढ़ते हुए, मैं डेप्थोंकैट परत के पार आया , प्रस्तावित इंसेप्शन मॉड्यूल का एक बिल्डिंग ब्लॉक , जो अलग-अलग आकार के कई दसियों के आउटपुट को जोड़ता है। लेखक इसे "फ़िल्टर कॉन्टेनेशन" कहते हैं। मशाल के लिए एक कार्यान्वयन प्रतीत होता है , …

1
स्किकिट भविष्यवाणी_प्रोबा आउटपुट व्याख्या
मैं अजगर में स्किटिट-लर्न लाइब्रेरी के साथ काम कर रहा हूं। नीचे दिए गए कोड में, मैं संभावना का अनुमान लगा रहा हूं लेकिन मुझे नहीं पता कि आउटपुट कैसे पढ़ा जाए। परीक्षण डेटा from sklearn.ensemble import RandomForestClassifier as RF from sklearn import cross_validation X = np.array([[5,5,5,5],[10,10,10,10],[1,1,1,1],[6,6,6,6],[13,13,13,13],[2,2,2,2]]) y = np.array([0,1,1,0,1,2]) …

1
LASSO में नियमितीकरण पैरामीटर के लिए सीमा और ग्रिड घनत्व चुनना
मैं इस दौरान LASSO (कम से कम पूर्ण संकोचन और चयन ऑपरेटर) का अध्ययन कर रहा हूं । मैं देख रहा हूं कि नियमितीकरण पैरामीटर के लिए इष्टतम मूल्य को क्रॉस सत्यापन द्वारा चुना जा सकता है। मैं रिज रिग्रेशन और कई तरीकों को भी देखता हूं जो नियमितीकरण को …

2
सामान्य वितरण में x का अपेक्षित मूल्य, GIVEN कि यह एक निश्चित मूल्य से कम है
बस अगर यह सामान्य रूप से वितरित किया गया है तो एक्स के अपेक्षित मूल्य को खोजने के लिए संभव है, यह देखते हुए कि निश्चित मूल्य से नीचे है (उदाहरण के लिए, औसत मूल्य से नीचे)।

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.