सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

4
आर में स्टैटा के "मजबूत" विकल्प की नकल करना
मैं robustR में Stata विकल्प के परिणामों को दोहराने की कोशिश कर रहा हूं। मैंने rlmMASS पैकेज के कमांड फॉर्म का उपयोग किया है और lmrobपैकेज "कमांडबस" से भी। दोनों मामलों में परिणाम स्टाटा में "मजबूत" विकल्प से काफी अलग हैं। क्या कोई इस संदर्भ में कुछ सुझाव दे सकता …

3
क्रॉस-मान्यता का उपयोग करते समय एक मानक त्रुटि नियम के लिए अनुभवजन्य औचित्य
क्या कोई अनुभवजन्य अध्ययन पारसीमोनी के पक्ष में एक मानक त्रुटि नियम के उपयोग को सही ठहरा रहा है? जाहिर है कि यह डेटा के डेटा-जनरेशन प्रोसेस पर निर्भर करता है, लेकिन डेटासेट के एक बड़े कॉर्पस का विश्लेषण करने वाली कोई भी चीज़ बहुत दिलचस्प होगी। क्रॉस-वेलिडेशन के माध्यम …

3
क्या लॉजिस्टिक रिग्रेशन फिट करने से पहले मानकीकरण की आवश्यकता है?
मेरा सवाल यह है कि लॉजिस्टिक रिग्रेशन को फिट करने से पहले हमें यह सुनिश्चित करने के लिए डेटा सेट को मानकीकृत करने की ज़रूरत है कि सभी वेरिएबल्स के बीच एक ही पैमाना हो, [0,1]। सूत्र है: xi−min(xi)max(xi)−min(xi)xi−min(xi)max(xi)−min(xi)\frac{x_i-\min(x_i)}{\max(x_i)-\min(x_i)} मेरे डेटा सेट में 2 चर हैं, वे दो चैनलों के …

1
आर में रैंक - अवरोही क्रम [बंद]
मैं डेटा रैंक करना चाह रहा हूं, कुछ मामलों में, बड़े मूल्य की रैंक 1 है। मैं आर के लिए अपेक्षाकृत नया हूं, लेकिन मैं यह नहीं देखता कि मैं इस फ़ंक्शन को रैंक फ़ंक्शन में कैसे समायोजित कर सकता हूं। x <- c(23,45,12,67,34,89) rank(x) उत्पन्न करता है: [1] 2 …
39 r 

5
AICc के लिए नकारात्मक मान (सुधारा गया Akaike सूचना मानदंड)
मैंने दो सामान्य रैखिक मिश्रित मॉडल की तुलना करने के लिए एआईसी और एआईसीसी की गणना की है; AIC मॉडल 2 से कम AIC वाले मॉडल 1 के साथ सकारात्मक हैं। हालांकि, AICc के लिए मान दोनों नकारात्मक हैं (मॉडल 1 अभी भी <मॉडल 2 है)। क्या नकारात्मक AICc मानों …

1
प्रतिगमन और PCA में अवरोधन से डेटा को कैसे केंद्रित किया जाता है?
मैं ऐसे उदाहरणों के बारे में पढ़ता रहता हूं जहां हम डेटा को केंद्र में रखते हैं (उदाहरण के लिए, नियमितीकरण या पीसीए के साथ) ताकि इंटरसेप्ट को हटा दिया जाए (जैसा कि इस प्रश्न में वर्णित है )। मुझे पता है कि यह सरल है, लेकिन मुझे यह समझने …


6
मुझे 100% सटीकता का निर्णय पेड़ क्यों मिलता है?
मुझे अपने निर्णय वृक्ष के लिए 100% सटीकता मिल रही है। मैं क्या गलत कर रहा हूं? यह मेरा कोड है: import pandas as pd import json import numpy as np import sklearn import matplotlib.pyplot as plt data = np.loadtxt("/Users/Nadjla/Downloads/allInteractionsnum.csv", delimiter=',') x = data[0:14] y = data[-1] from sklearn.cross_validation import …

3
निर्णय पेड़ अनिवार्य रूप से महंगे क्यों नहीं हैं?
में आर में आवेदन के साथ सांख्यिकीय लर्निंग के लिए एक परिचय , लेखक लिखते हैं कि फिटिंग एक निर्णय वृक्ष बहुत तेजी से है, लेकिन यह मेरे लिए कोई मतलब नहीं है। एल्गोरिथ्म को हर सुविधा से गुजरना पड़ता है और इसे हर तरह से विभाजित करना होता है …
38 cart 

2
पक्षपाती अनुमानक कब निष्पक्ष एक के लिए बेहतर है?
यह कई बार स्पष्ट है कि कोई निष्पक्ष अनुमानक क्यों पसंद करता है। लेकिन, क्या ऐसी परिस्थितियां हैं, जिनके तहत हम वास्तव में निष्पक्ष व्यक्ति पर पक्षपाती अनुमानक को पसंद कर सकते हैं?

4
R के साथ प्लॉटिंग के लिए, मुझे ggplot2 या ggvis सीखना चाहिए?
R के साथ प्लॉटिंग के लिए, मुझे ggplot2 या ggvis सीखना चाहिए? मैं जरूरी नहीं कि दोनों सीखना चाहते हैं अगर उनमें से किसी भी संबंध में बेहतर है। क्यों आर समुदाय अतिव्यापी कार्यक्षमता के साथ नए पैकेज बनाता रहता है? परिचय ब्लॉग पोस्ट एक शब्द क्यों ggvis दिया बनाया …

5
पूर्ण त्रुटि को कम करने के बराबर चुकता त्रुटि न्यूनतम है? चुकता त्रुटि बाद की तुलना में अधिक लोकप्रिय क्यों है?
जब हम डेटा बिंदुओं के एक समूह को फिट करने के लिए रैखिक प्रतिगमन का संचालन करते हैं , तो क्लासिक दृष्टिकोण चुकता त्रुटि को कम करता है। मैं लंबे समय से एक प्रश्न से हैरान हूं कि क्या चुकता त्रुटि को कम करके पूर्ण त्रुटि को कम करने के …

3
बूटस्ट्रैप्ड रिसैम्पल्स से लिया गया एक आत्मविश्वास अंतराल का क्या अर्थ है?
मैं बूटस्ट्रैपिंग और आत्मविश्वास अंतराल के बारे में इस साइट पर कई सवाल देख रहा हूं, लेकिन मैं अभी भी भ्रमित हूं। मेरी उलझन का कारण शायद यह है कि मैं बहुत सारे उत्तरों को समझने के लिए अपने आँकड़ों के ज्ञान में पर्याप्त उन्नत नहीं हूँ। मैं परिचयात्मक सांख्यिकी …

3
बहुपद प्रतिगमन को कई रेखीय प्रतिगमन का एक विशेष मामला क्यों माना जाता है?
यदि बहुपद प्रतिगमन गैर-संबंध संबंध मॉडल करता है, तो इसे एकाधिक रैखिक प्रतिगमन का एक विशेष मामला कैसे माना जा सकता है? विकिपीडिया नोट करता है कि "हालांकि बहुपद प्रतिगमन डेटा के लिए एक अरेखीय मॉडल फिट बैठता है, एक सांख्यिकीय अनुमान समस्या के रूप में यह रैखिक है, इस …

2
सशर्त और बिना शर्त मात्रात्मक प्रतिगमन के बीच अंतर क्या है?
कोन्केर और बासेट (1978) द्वारा दशात्मक मात्रात्मक प्रतिगमन अनुमानक को परिमाण को रूप में परिभाषित किया गया है। जहां \ rho_ \ tau = u_i \ cdot (\ tau - 1 (u_i <0)) एक पुन: भारोत्तोलन फ़ंक्शन ("चेक" -function कहा जाता है) बच के u_i ।τthτth\tau^{th} βˆQR=minb∑i=1nρτ(yi−X′ibτ)β^QR=minb∑i=1nρτ(yi−Xi′bτ) \widehat{\beta}_{QR} = \min_{b} …

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.