सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

1
एक SVM ग्रिड खोज को उच्च सटीकता वाले क्षेत्र को कम सटीकता के साथ दिखाना चाहिए?
मेरे पास 12 सकारात्मक प्रशिक्षण सेट हैं (कैंसर कोशिकाओं को कार्रवाई के 12 अलग-अलग तंत्रों के साथ दवाओं के साथ इलाज किया जाता है)। इन सकारात्मक प्रशिक्षण सेटों में से प्रत्येक के लिए, मैं एक सपोर्ट-वेक्टर मशीन को प्रशिक्षित करना चाहता हूं ताकि इसे प्रयोग से प्राप्त समान आकार के …
12 svm 

4
कुल मिलाकर प्रतिस्थापन के बिना, एक बड़ी सूची से 10 के कई नमूने कैसे लें
मुझे डेटा (20,000 डेटा पॉइंट) का एक बड़ा सेट मिला है, जिसमें से मैं 10 डेटा पॉइंट्स के बार-बार नमूने लेना चाहता हूं। हालांकि, एक बार मैंने उन 10 डेटा बिंदुओं को चुना है, मैं चाहता हूं कि उन्हें फिर से नहीं चुना जाए। मैंने sampleफ़ंक्शन का उपयोग करने की …
12 r  sample 

1
भग्न गणित पर आधारित आंकड़े
मैं भग्न गणित पर आधारित आँकड़ों पर पुस्तकों / पाठ्य पुस्तकों की तलाश में हूँ। मुझे पता है कि यह बहुत अच्छी तरह से जाना जाने वाला क्षेत्र नहीं है और अच्छा साहित्य मिलना मुश्किल है। किसी भी सुझाव का स्वागत है (किताबें, पाठ्यपुस्तकें, ऑनलाइन सामग्री)।

3
क्यों एक lagged का उपयोग DV एक वाद्य चर के रूप में?
मुझे कुछ डेटा विश्लेषण कोड विरासत में मिले हैं, जो कि अर्थशास्त्री नहीं होने के कारण मुझे समझने में दिक्कत हो रही है। एक मॉडल निम्नलिखित Stata कमांड के साथ एक इंस्ट्रूमेंटल वैरिएबल रिग्रेशन चलाता है ivreg my_dv var1 var2 var3 (L.my_dv = D2.my_dv D3.my_dv D4.my_dv) यह डेटासेट एक पैनल …

4
बड़े अल्फा और बीटा के साथ बीटा वितरण के लिए मैं (संख्यात्मक रूप से) अनुमानित मूल्य कैसे कर सकता हूं
क्या बड़े पूर्णांक अल्फा, बीटा (जैसे अल्फा, बीटा> 1000000) के लिए बीटा वितरण के मूल्यों की गणना करने के लिए संख्यात्मक रूप से स्थिर तरीका है ? वास्तव में, मुझे केवल मोड के चारों ओर 99% विश्वास अंतराल की आवश्यकता है, अगर वह किसी तरह समस्या को आसान बनाता है। …

2
मुझे अच्छे आंकड़े कहां मिल सकते हैं?
परिचयात्मक, उन्नत, और यहां तक ​​कि अस्पष्ट, कृपया। ज्यादातर खुद को परखने के लिए। मुझे यकीन है कि मुझे पता है कि मैं किस बिल्ली के बारे में बात कर रहा हूं :) धन्यवाद
12 teaching 

4
किसी दिए गए आकलन तकनीक और मापदंडों के लिए एक नमूना कितना बड़ा होना चाहिए?
क्या किसी नियम या अंगूठे का कोई तरीका भी यह बताने के लिए है कि किसी दिए गए मापदंडों के साथ मॉडल का अनुमान लगाने के लिए कितना बड़ा नमूना होना चाहिए? इसलिए, उदाहरण के लिए, यदि मैं 5 मापदंडों के साथ एक न्यूनतम-वर्ग प्रतिगमन का अनुमान लगाना चाहता हूं, …

3
मैं कैसे परीक्षण कर सकता हूं कि बाइनरी डेटा की मेरी क्लस्टरिंग महत्वपूर्ण है या नहीं
मैं खरीदारी कार्ट विश्लेषण कर रहा हूं मेरे डेटासेट लेन-देन का सेट, उन वस्तुओं के साथ है जो उत्पादों को खरीदा जा रहा है। लेन-देन पर के-साधन लागू करते समय, मुझे हमेशा कुछ परिणाम मिलेगा । एक यादृच्छिक मैट्रिक्स शायद कुछ समूहों को भी दिखाएगा। क्या यह परीक्षण करने का …

1
उन नमूना बिंदुओं को कैसे खोजें, जिनमें बिंदु के दो मूल्यों के बीच सांख्यिकीय रूप से बड़े बहिर्गामी अनुपात हैं?
एक उदाहरण के अनुप्रयोग के रूप में, स्टैक ओवरफ्लो उपयोगकर्ताओं के दो गुणों पर विचार करें: प्रतिष्ठा और प्रोफ़ाइल दृश्य मायने रखता है । यह उम्मीद की जाती है कि अधिकांश उपयोगकर्ताओं के लिए वे दो मूल्य आनुपातिक होंगे: उच्च प्रतिनिधि उपयोगकर्ता अधिक ध्यान आकर्षित करते हैं और इसलिए अधिक …
12 ratio 

1
क्या (पांडा) ऑटोकैरेलेशन ग्राफ दिखाता है?
मैं एक शुरुआत कर रहा हूं और मैं यह समझने की कोशिश कर रहा हूं कि आटोक्लेररेशन ग्राफ क्या दर्शाता है। मैंने विभिन्न स्रोतों जैसे कि इस पृष्ठ या दूसरों के बीच संबंधित विकिपीडिया पृष्ठ से कई स्पष्टीकरण पढ़े हैं, जिनका मैं यहाँ हवाला नहीं दे रहा हूँ। मेरे पास …

2
एमएलडी में सॉफ्टमैक्स फ़ंक्शन और थर्मोडायनेमिक्स में बोल्ट्जमैन वितरण के बीच संबंध कितना गहरा है?
सॉफ्टमैक्स फ़ंक्शन, जिसे आमतौर पर न्यूरल नेटवर्क में वास्तविक संख्याओं को संभावनाओं में परिवर्तित करने के लिए उपयोग किया जाता है, बोल्ट्जमन वितरण के समान ही फ़ंक्शन है, थर्मोडायनेमिक्स में दिए गए टी पर थर्मल संतुलन में कणों के संयोजन के लिए ऊर्जा पर संभाव्यता वितरण। मैं कुछ स्पष्ट विषम …

3
ट्रेन / टेस्ट / सत्यापन सेट में विभाजित समय श्रृंखला डेटा
ट्रेन / परीक्षण / सत्यापन सेट में टाइम सीरीज़ डेटा को विभाजित करने का सबसे अच्छा तरीका क्या है, जहां हाइपरपरमीटर ट्यूनिंग के लिए सत्यापन सेट का उपयोग किया जाएगा? हमारे पास दैनिक बिक्री डेटा के 3 साल का मूल्य है, और हमारी योजना 2015-2016 को प्रशिक्षण डेटा के रूप …

2
MCMC नमूने के लिए Jeffreys या एन्ट्रापी आधारित पुजारियों का उपयोग करने के खिलाफ सिफारिशें क्यों हैं?
पर उनके विकि पृष्ठ , स्टेन राज्य के डेवलपर्स: कुछ सिद्धांत हमें पसंद नहीं हैं: आक्रमणकारी, जेफ्रीज़, एन्ट्रॉपी इसके बजाय, मुझे बहुत अधिक सामान्य वितरण अनुशंसा दिखाई देती है। अब तक मैंने बायेसियन विधियों का उपयोग किया था, जो नमूने पर भरोसा नहीं करते थे, और यह समझने में प्रसन्नता …
12 bayesian  mcmc  prior  pymc  stan 

2
हम हार्मोनिक माध्य के बजाय भारित अंकगणित माध्य का उपयोग क्यों नहीं करते हैं?
मुझे आश्चर्य है कि सटीक और याद के संयोजन में भारित अंकगणितीय माध्य के विपरीत हार्मोनिक माध्य (उदाहरण के लिए एफ-उपायों की गणना करने के लिए) का उपयोग करने का एक आंतरिक मूल्य क्या है? मैं सोच रहा हूं कि भारित अंकगणित औसत हार्मोनिक माध्य की भूमिका निभा सकता है, …

2
CNN में फ़िल्टर आकार, स्ट्राइड्स आदि चुनना?
मैं स्टैनफोर्ड के CS231N व्याख्यानों को देख रहा हूं और मैं CNN आर्किटेक्चर में कुछ मुद्दों पर अपना सिर लपेटने की कोशिश कर रहा हूं। मैं जो समझने की कोशिश कर रहा हूं वह यह है कि क्या कनवल्शन फिल्टर साइज़ को चुनने के लिए कुछ सामान्य दिशा-निर्देश हैं और …

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.