सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

1
एक ही तिरछी नल के लिए दो स्वतंत्र नमूनों का परीक्षण?
अशक्त परिकल्पना के लिए दो स्वतंत्र नमूनों के परीक्षण के लिए कौन से परीक्षण उपलब्ध हैं कि वे एक ही तिरछा के साथ आबादी से आते हैं? एक शास्त्रीय 1-नमूना परीक्षण है कि क्या तिरछा एक निश्चित संख्या के बराबर है (परीक्षण में 6 वें नमूना क्षण शामिल है?); 2-नमूना …

4
कैसे वर्गीकृत डेटा को संक्षेप में प्रस्तुत करें?
मैं उम्मीद के साथ निम्नलिखित समस्या से जूझ रहा हूं, यह सांख्यिकीविदों के लिए एक आसान है (मैं आंकड़ों के कुछ जोखिम के साथ एक प्रोग्रामर हूं)। मुझे एक सर्वेक्षण (प्रबंधन के लिए) के लिए प्रतिक्रियाओं को संक्षेप में प्रस्तुत करने की आवश्यकता है। सर्वेक्षण में 100+ प्रश्न हैं, जो …

3
बॉक्स-कॉक्स रूपांतरित डेटा में मूल इकाइयों के संदर्भ में एक्सप्रेस व्यक्त करें
कुछ मापों के लिए, एक विश्लेषण के परिणाम उचित रूप से रूपांतरित पैमाने पर प्रस्तुत किए जाते हैं। ज्यादातर मामलों में, हालांकि, माप के मूल पैमाने पर परिणाम प्रस्तुत करना वांछनीय है (अन्यथा आपका काम कम या ज्यादा बेकार है)। उदाहरण के लिए, लॉग-ट्रांसफ़ॉर्म किए गए डेटा के मामले में, …

3
दूरी और मात्रा को परिभाषित करने के लिए सूचना ज्यामिति का उपयोग ... उपयोगी?
मैं साहित्य के एक बड़े निकाय में आया था जो फ़िशर की सूचना मीट्रिक को संभावना वितरण के स्थान पर प्राकृतिक स्थानीय मीट्रिक के रूप में उपयोग करने की वकालत करता है और फिर दूरी और मात्रा को परिभाषित करने के लिए इसे एकीकृत करता है। लेकिन क्या ये "एकीकृत" …

5
डेटा विज़ुअलाइज़ेशन तकनीकों की संज्ञानात्मक प्रसंस्करण / व्याख्या
क्या किसी को अनुसंधान के बारे में पता है जो विभिन्न दृश्य तकनीकों की प्रभावशीलता (समझ) की जांच करता है? उदाहरण के लिए, लोग कितनी जल्दी एक दूसरे पर दृश्य के एक रूप को समझते हैं? क्या विज़ुअलाइज़ेशन के साथ सहभागिता से लोगों को डेटा याद करने में मदद मिलती …

1
परिपत्र आँकड़ों में उच्च क्षणों के लिए अंतर्ज्ञान
परिपत्र के आंकड़ों में, एक यादृच्छिक चर की उम्मीद के मूल्य सर्कल पर मूल्यों के साथ एस के रूप में परिभाषित किया गया है मी 1 ( जेड ) = ∫ एस जेड पी जेड ( θ ) घ θ (देखें विकिपीडिया )। यह एक बहुत ही प्राकृतिक परिभाषा है, …

5
विभिन्न लंबाई की समय श्रृंखला के लिए एसवीडी की गतिशीलता में कमी
मैं एक विलक्षण कमी तकनीक के रूप में एकवचन मूल्य अपघटन का उपयोग कर रहा हूं। Nआयाम के वैक्टर को देखते हुए D, यह विचार असंबद्ध आयामों के एक परिवर्तित स्थान में सुविधाओं का प्रतिनिधित्व करने के लिए है, जो महत्व के घटते क्रम में इस स्थान के आइजनवेक्टर्स में …

3
रैखिक मिश्रित प्रभाव मॉडल
मैंने आमतौर पर सुना है कि एलएमई मॉडल सटीकता डेटा (यानी मनोविज्ञान प्रयोगों में) के विश्लेषण में अधिक ध्वनि हैं, जिसमें वे द्विपद और अन्य गैर-सामान्य वितरणों के साथ काम कर सकते हैं जो पारंपरिक दृष्टिकोण (जैसे, एनोवा) नहीं कर सकते। एलएमई मॉडल का गणितीय आधार क्या है जो उन्हें …

4
डेटा अज्ञातकरण सॉफ्टवेयर
ताला लगा हुआ । यह सवाल और इसके जवाब बंद हैं क्योंकि यह सवाल ऑफ-टॉपिक है लेकिन इसका ऐतिहासिक महत्व है। यह वर्तमान में नए उत्तरों या इंटरैक्शन को स्वीकार नहीं कर रहा है। क्या किसी को अच्छे डेटा एनोनिमा सॉफ्टवेयर के बारे में पता है? या शायद आर के …
13 software 

4
नमूने से दो आबादी को अलग करना
मैं एक ही डेटा सेट से मूल्यों के दो समूहों को अलग करने की कोशिश कर रहा हूं। मैं मान सकता हूं कि आबादी में से एक सामान्य रूप से वितरित की गई है और नमूने का कम से कम आधा आकार है। दूसरे वाले का मान पहले वाले (वितरण …

2
हिंसक व्यवहार का विश्लेषण / भविष्यवाणी करने के लिए समय श्रृंखला विश्लेषण का उपयोग करना
यह थोड़ा फ़्लिप्टेंट सवाल है, लेकिन मुझे जवाब में गंभीर दिलचस्पी है। मैं एक मनोरोग अस्पताल में काम करता हूं और मेरे पास उस वार्ड पर हिंसा के स्तर के बारे में प्रत्येक वार्ड में हर दिन एकत्र किए गए तीन साल के आंकड़े हैं। स्पष्ट रूप से जो मॉडल …

5
भविष्यवाणी के लिए कई मॉडल का उपयोग कब करें?
यह एक सामान्य प्रश्न है: मैंने आमतौर पर पाया है कि नमूना से बाहर समय श्रृंखला की भविष्यवाणी करने की कोशिश करते समय एक मॉडल के कई अलग-अलग मॉडल का उपयोग करना। क्या कोई अच्छा पेपर है जो प्रदर्शित करता है कि मॉडल का संयोजन एकल मॉडल को बेहतर बना …

2
जीएलएम का परिवार प्रतिक्रिया चर या अवशिष्ट के वितरण का प्रतिनिधित्व करता है?
मैं इस बारे में कई प्रयोगशाला सदस्यों के साथ चर्चा कर रहा हूं, और हम कई स्रोतों से गए हैं, लेकिन अभी भी इसका जवाब नहीं है: जब हम कहते हैं कि एक जीएलएम के पास पोइसोन का एक परिवार है तो मान लें कि हम अवशिष्टों के वितरण या …

1
क्या बाइनरी वर्गीकरण सेटिंग में सटीकता एक अनुचित स्कोरिंग नियम है?
मैं हाल ही में संभाव्य कक्षा के लिए उचित स्कोरिंग नियमों के बारे में सीख रहा हूं। इस वेबसाइट पर कई थ्रेड्स ने इस बात पर जोर दिया है कि सटीकता एक अनुचित स्कोरिंग नियम है और इसका उपयोग लॉजिस्टिक रिग्रेशन जैसे एक संभाव्य मॉडल द्वारा उत्पन्न भविष्यवाणियों की गुणवत्ता …

1
रैंडम फॉरेस्ट में, पेड़ के स्तर के बजाय नोड स्तर पर सुविधाओं का एक यादृच्छिक सबसेट क्यों चुना जाता है?
मेरा प्रश्न: रैंडम फ़ॉरेस्ट प्रत्येक पेड़ के बजाय नोड स्तर पर बंटवारे के लिए सुविधाओं के यादृच्छिक सबसेट पर विचार क्यों करता है ? पृष्ठभूमि: यह एक इतिहास का सवाल है। टिन कम हो ने 1998 में प्रत्येक पेड़ को उगाने के लिए सुविधाओं के एक सबसेट का चयन करके …

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.