सांख्यिकी और बिग डेटा

Q & A में सांख्यिकी, मशीन लर्निंग, डेटा विश्लेषण, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन में रुचि रखने वाले लोगों के लिए

1
अव्यक्त Dirichlet आवंटन का उपयोग करते हुए विषय की भविष्यवाणी
मैंने दस्तावेजों के एक कोष पर एलडीए का उपयोग किया है और कुछ विषयों को पाया है। मेरे कोड का आउटपुट प्रायिकता वाले दो मैट्रिक्स हैं; एक डॉक्टर-विषय की संभाव्यता और दूसरा शब्द-विषय की संभावनाएँ। लेकिन मैं वास्तव में एक नए दस्तावेज़ के विषय की भविष्यवाणी करने के लिए इन …

1
बूस्टिंग और पेड़ लगाना (XGBoost, LightGBM)
कई ब्लॉग पोस्ट, यूट्यूब वीडियो, आदि के विचारों के बारे में कर रहे हैं जीत या बढ़ाने के पेड़। मेरी सामान्य समझ यह है कि प्रत्येक के लिए छद्म कोड है: जीतना: नमूने के x% और सुविधाओं के y% के N यादृच्छिक नमूने लें अपने मॉडल (जैसे, निर्णय पेड़) को …

5
"इन-सैंपल" और "आउट-ऑफ-सैंपल" पूर्वानुमानों में क्या अंतर है?
मुझे समझ नहीं आया कि वास्तव में "इन-सैंपल" और "आउट ऑफ सैंपल" की भविष्यवाणी में क्या अंतर है? अनुमान के अवधि के बाहर मूल्यों का पूर्वानुमान करने के लिए एक नमूना-नमूना पूर्वानुमान उपलब्ध आंकड़ों के सबसेट का उपयोग करता है । नमूना उपलब्ध पूर्वानुमान के बजाय सभी उपलब्ध डेटा का …

2
यादृच्छिक प्रभावों के साथ क्रमिक लॉजिस्टिक प्रतिगमन का उपयोग कैसे करें?
अपने अध्ययन में मैं कई मेट्रिक्स के साथ वर्कलोड को मापूंगा। हृदय-दर परिवर्तनशीलता (एचआरवी), इलेक्ट्रोडर्मल गतिविधि (ईडीए) और एक व्यक्तिपरक पैमाने (आईडब्ल्यूएस) के साथ। सामान्य होने के बाद IWS के तीन मूल्य हैं: काम का बोझ सामान्य से कम वर्कलोड औसत है कार्यभार सामान्य से अधिक है। मैं देखना चाहता …

1
क्या कॉस्मिक समानता, पीयरसन सहसंबंध और जेड-स्कोर के बीच कोई संबंध है?
मुझे आश्चर्य हो रहा है कि क्या इन 3 उपायों में कोई संबंध है। मैं परिभाषाओं का उल्लेख करके उनके बीच एक संबंध बनाने के लिए प्रतीत नहीं कर सकता (संभवतः क्योंकि मैं इन परिभाषाओं के लिए नया हूं और उन्हें रगड़ने में थोड़ा समय लग रहा है)। मुझे पता …

2
प्रतिगमन के लिए परिभाषा प्राकृतिक घन विभाजन
मैं हेस्टी एट अल की पुस्तक "द एलिमेंट्स ऑफ़ स्टैटिस्टिकल लर्निंग डेटा माइनिंग, इनर्विज़न एंड प्रेडिक्शन" से स्प्लिन्स के बारे में सीख रहा हूँ। मैंने पृष्ठ १४५ पर पाया कि प्राकृतिक क्यूबिक स्प्लीन सीमा गांठों से परे रैखिक होते हैं। कर रहे हैं KKK समुद्री मील, में splines और निम्नलिखित …

2
कोलमोगोरोव-स्मिरनोव परीक्षण को समझना आर
मैं कोलमोगोरोव-स्मिरनोव परीक्षण फ़ंक्शन (दो नमूने, दो तरफा) के आउटपुट को समझने की कोशिश कर रहा हूं। यहाँ एक सरल परीक्षण है। x <- c(1,2,2,3,3,3,3,4,5,6) y <- c(2,3,4,5,5,6,6,6,6,7) z <- c(12,13,14,15,15,16,16,16,16,17) ks.test(x,y) # Two-sample Kolmogorov-Smirnov test # #data: x and y #D = 0.5, p-value = 0.1641 #alternative hypothesis: two-sided …

2
ग्रैडिएंट बूस्टिंग के साथ वर्गीकरण: भविष्यवाणी को कैसे रखें [0,1]
प्रश्न मैं यह समझने के लिए संघर्ष कर रहा हूं कि कैसे ग्रैडिएंट बूस्टिंग के साथ द्विआधारी वर्गीकरण करते समय भविष्यवाणी अंतराल के भीतर रखी जाती है ।[0,1][0,1][0,1] मान लें कि हम एक द्विआधारी वर्गीकरण समस्या पर काम कर रहे हैं, और हमारे उद्देश्य समारोह लॉग नुकसान हुआ है, , …

1
आर में घनत्व फ़ंक्शन से संभाव्यता घनत्व फ़ंक्शन को खोजने / अनुमान लगाने का तरीका
मान लीजिए कि मेरे पास Xअज्ञात वितरण के समान एक चर है । मेथेमेटिका में, का उपयोग करके SmoothKernelDensityसमारोह हम एक अनुमान के अनुसार घनत्व function.This अनुमान घनत्व समारोह के साथ साथ इस्तेमाल किया जा सकता हो सकता है PDFकी तरह एक मूल्य की गणना करें प्रायिकता घनत्व समारोह के …
17 r  pdf  cdf 

3
बायेसियन पैरामीटर अनुमान में पूर्व का चयन कैसे करें
मैं पैरामीटर आकलन, एमएल, एमएपी और बेयस दृष्टिकोण करने के लिए 3 तरीके जानता हूं। और एमएपी और बेयस दृष्टिकोण के लिए, हमें मापदंडों के लिए पुजारी चुनने की आवश्यकता है, है ना? मैं इस मॉडल का कहना है कि p(x|α,β)p(x|α,β)p(x|\alpha,\beta) , जिसमें α,βα,β\alpha,\beta आदेश एमएपी या Bayes का उपयोग …

2
कई आउटपुट के साथ एक यादृच्छिक वन संभव / व्यावहारिक होगा?
रैंडम वन (RFs) एक प्रतिस्पर्धी डेटा मॉडलिंग / खनन विधि है। एक RF मॉडल में एक आउटपुट होता है - आउटपुट / पूर्वानुमान चर। आरएफ के साथ कई आउटपुट मॉडलिंग के लिए भोली दृष्टिकोण प्रत्येक आउटपुट चर के लिए एक आरएफ का निर्माण होगा। इसलिए हमारे पास एन स्वतंत्र मॉडल …

2
आर में "गुणांक: 14 विलक्षणताओं के कारण परिभाषित नहीं" जैसी त्रुटि से कैसे निपटें?
जीवीएम करते समय और आपको "आउटपुट में विलक्षणताओं के कारण परिभाषित नहीं किया गया" प्राप्त होता है, कैसे एनोवा आउटपुट में त्रुटि होती है? कुछ लोगों ने सुझाव दिया है कि यह सहसंयोजकों के बीच मिलीभगत के कारण है या कि कोई एक स्तर डेटासेट में मौजूद नहीं है (देखें: …

2
गैर-रेखीय प्रतिगमन पर साहित्य समीक्षा
क्या किसी को गैर-रेखीय प्रतिगमन पर सांख्यिकीय साहित्य के लिए एक अच्छी समीक्षा लेख का पता है? मुझे मुख्य रूप से संगति परिणाम और स्पर्शोन्मुख दवाओं में रुचि है। विशेष रुचि मॉडल है yit=m(xit,θ)+ϵit,yit=m(xit,θ)+ϵit,y_{it} = m(x_{it},\theta) + \epsilon_{it}, पैनल डेटा के लिए। कम ब्याज की गैर-पैरामीट्रिक विधियां हैं। पत्रिकाओं को …


3
वर्ग की संभाव्यता का अनुमान ``ैंड्रैंडफ़ॉरफेस्ट` कैसे करता है?
randomForestजब मैं उपयोग करता हूं तो पैकेज की कक्षा की संभावनाओं का अनुमान कैसे लगाया जाता है predict(model, data, type = "prob")? मैं संभावनाओं का अनुमान लगाने rangerके probability = Tतर्क का उपयोग करके यादृच्छिक जंगलों के प्रशिक्षण के लिए उपयोग कर रहा था । rangerप्रलेखन में कहते हैं कि …

हमारी साइट का प्रयोग करके, आप स्वीकार करते हैं कि आपने हमारी Cookie Policy और निजता नीति को पढ़ और समझा लिया है।
Licensed under cc by-sa 3.0 with attribution required.