सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

4
उन सभी चरों को लॉग-ट्रांसफ़ॉर्म क्यों न करें जो मुख्य रुचि के नहीं हैं?
पुस्तकों और चर्चाओं में अक्सर कहा जाता है कि जब एक भविष्यवक्ता के साथ समस्याओं (जिनमें से कुछ का सामना करना पड़ता है) का सामना करना पड़ता है, तो यह एक संभावना है। अब, मैं समझता हूं कि यह वितरण पर निर्भर करता है और भविष्यवाणियों में सामान्यता प्रतिगमन की …

2
ग्रोथ चार्ट बनाने की सबसे अच्छी विधि
मुझे 5 से 15 वर्ष की आयु के बच्चों के लिए (ग्रोथ चार्ट के समान) चार्ट बनाने हैं (केवल 5,6,7 इत्यादि; स्वास्थ्य चर के लिए कोई भिन्न मान नहीं हैं) जो गैर-नकारात्मक, निरंतर और में है 50-150 की सीमा (इस सीमा के बाहर केवल कुछ मूल्यों के साथ)। मुझे ९ …

1
बताते हैं कि यदि
वर्तमान में इस पर अटक गया है, मुझे पता है कि मुझे शायद द्विपद वितरण के औसत विचलन का उपयोग करना चाहिए लेकिन मैं इसका पता नहीं लगा सकता।

3
टाइम्स श्रृंखला विश्लेषण बनाम मशीन सीखने?
बस एक सामान्य सवाल है। यदि आपके पास समय श्रृंखला डेटा है, तो मशीन / सांख्यिकीय सीखने की तकनीक (KNN, प्रतिगमन) से अधिक समय श्रृंखला तकनीकों (उर्फ, ARCH, GARCH, आदि) का उपयोग करना बेहतर है। यदि कोई ऐसा ही सवाल है जो क्रॉस्लेटिड पर मौजूद है, तो कृपया मुझे इसकी …

1
रैंडम फॉरेस्ट प्रोबेबिलिस्टिक भविष्यवाणी बनाम बहुमत वोट
स्किकिट सीखता है कि मॉडल एकत्रीकरण तकनीक के लिए बहुसंख्यक वोट के बजाय संभाव्य भविष्यवाणी का उपयोग क्यों (1.9.2.1। रैंडम फॉरेस्ट) के स्पष्टीकरण के बिना किया जाता है। क्या इसके लिए एक स्पष्ट व्याख्या है? इसके अलावा, विभिन्न मॉडल एकत्रीकरण तकनीकों के लिए एक अच्छा पेपर या समीक्षा लेख है …

3
जब आप बड़े एन, असतत डेटा, और कई चर हैं, तो स्कैप्लेट मैट्रिक्स से जानकारी कैसे निकालें?
मैं स्तन कैंसर के प्रेग्नेंट के साथ खेल रहा हूं और एक विचार प्राप्त करने के लिए सभी विशेषताओं का एक स्कैल्प बनाया है, जिसके लिए (लाल) वर्ग malignant(नीला) की भविष्यवाणी करने पर सबसे अधिक प्रभाव पड़ता है benign। मैं समझता हूं कि पंक्ति x अक्ष का प्रतिनिधित्व करती है …

1
MCMCpack बनाम बायसेगलम (बांह)
दोनों bayesglm()(बांह आर पैकेज में) और एमसीएमसीपैकेज पैकेज में विभिन्न कार्यों का उद्देश्य सामान्यीकृत रैखिक मॉडल के बेयसियन आकलन करना है, लेकिन मुझे यकीन नहीं है कि वे वास्तव में एक ही चीज की गणना कर रहे हैं। मॉडल मापदंडों के लिए संयुक्त पोस्टीरियर से (निर्भर) नमूना प्राप्त करने के …

2
मल्टीस्कल्स वर्गीकरण में स्किकिट एसवीएम का आउटपुट हमेशा एक ही लेबल देता है
मैं वर्तमान में निम्नलिखित कोड के साथ स्किकिट सीख रहा हूं: clf = svm.SVC(C=1.0, tol=1e-10, cache_size=600, kernel='rbf', gamma=0.0, class_weight='auto') और फिर 7 अलग-अलग लेबल वाले डेटा के सेट के लिए फिट और भविष्यवाणी करें। मुझे एक अजीब आउटपुट मिला। कोई बात नहीं जो मान्यता तकनीक को पार करता है मैं …

1
द्विआधारी अंतर्जात चर के साथ 2SLS की संगति
मैंने पढ़ा है कि 2SLS आकलनकर्ता अभी भी द्विआधारी अंतर्जात चर ( http://www.stata.com/statalist/archive/2004-07/msg00699.html ) के साथ संगत है । पहले चरण में, एक रेखीय मॉडल के बजाय एक प्रोबिट उपचार मॉडल चलाया जाएगा। क्या यह दिखाने के लिए कोई औपचारिक प्रमाण है कि 2SLS अभी भी सुसंगत है जब 1 …

2
प्रतिलोम स्वतंत्र चर के साथ प्रतिगमन
मान लीजिए कि मेरे पास आश्रित चर का -vector और स्वतंत्र चर का -vector है। जब को विरुद्ध प्लॉट किया जाता है , तो मैं देखता हूं कि दोनों के बीच एक रैखिक संबंध (उर्ध्वगामी प्रवृत्ति) है। अब, इसका मतलब यह भी है कि और बीच एक रैखिक गिरावट है …

2
समय श्रृंखला की पूर्वानुमान क्षमता का निर्धारण कैसे करें?
पूर्वानुमान द्वारा सामना किए जा रहे महत्वपूर्ण मुद्दों में से एक यह है कि क्या दी गई श्रृंखला का पूर्वानुमान लगाया जा सकता है या नहीं? मैं पीटर कैट द्वारा " एंट्रोपी फॉर ए ए प्रियोरी इंडिकेटर ऑफ फोरकास्टीबिलिटी " नामक एक लेख पर अड़ गया, जो किसी दिए गए …

1
Eigenvectors की दृश्य व्याख्या के बारे में उलझन: नेत्रहीन विभिन्न डेटासेट में एक ही eigenvectors कैसे हो सकते हैं?
बहुत सी सांख्यिकी पाठ्यपुस्तक एक सहज मैट्रिक्स के आइजनवेक्टर क्या हैं, का एक सहज चित्रण प्रदान करती हैं: वैक्टर यू और ज़ेड ईजेनवेक्टर (अच्छी तरह से, आइगेनैक्स) बनाते हैं। यह समझ में आता है। लेकिन एक चीज जो मुझे भ्रमित करती है, वह यह है कि हम ईजनवेक्टरों को सहसंबंध …

1
कम से कम घातीय वितरण के लिए अधिकतम संभावना अनुमानक
मैं इस समस्या को हल करने के तरीके पर अटका हुआ हूं। तो, हमारे पास लिए यादृच्छिक चर, और दो क्रम हैं । अब, और पैरामीटर और साथ स्वतंत्र घातीय वितरण हैं । हालाँकि, हम और देखने के बजाय और निरीक्षण करते हैं ।XiXiX_iYiYiY_ii=1,...,ni=1,...,ni=1,...,nXXXYYYλλ\lambdaμμ\muXXXYYYZZZWWW Z=min(Xi,Yi)Z=min(Xi,Yi)Z=\min(X_i,Y_i) और W=1W=1W=1 यदि Zi=XiZi=XiZ_i=X_i और …

2
अवशिष्ट निदान और रैखिक मिश्रित मॉडल में भिन्नता के समरूपता
इस प्रश्न को पूछने से पहले, मैंने हमारी साइट पर खोज की और बहुत सारे समान प्रश्न पाए, (जैसे यहाँ , यहाँ , और यहाँ )। लेकिन मुझे लगता है कि उन संबंधित प्रश्नों का अच्छी तरह से जवाब नहीं दिया गया या उन पर चर्चा नहीं की गई, इस …

3
K- का मतलब है कॉसाइन समानताएँ बनाम यूक्लिडियन दूरी (LSA)
मैं निचले आयामी स्थान में दस्तावेजों के एक कोष का प्रतिनिधित्व करने के लिए अव्यक्त अर्थ विश्लेषण का उपयोग कर रहा हूं। मैं k- साधनों का उपयोग करके इन दस्तावेजों को दो समूहों में बांटना चाहता हूं। कई साल पहले, मैंने पायथन के गेंसिम का उपयोग करके और अपने स्वयं …

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.