2
तंत्रिका नेटवर्क का उपयोग करते हुए क्यू-लर्निंग के बारे में प्रश्न
मैंने क्यू-लर्निंग को इस रूप में वर्णित किया है, http://web.cs.swarthmore.edu/~meeden/cs81/s12/papers/MarkStevePaper.pdf लगभग करने के लिए। क्यू (एस, ए) मैं निम्नलिखित की तरह एक तंत्रिका नेटवर्क संरचना का उपयोग करता हूं, एक्टिवेशन सिग्मॉइड एक्शन न्यूरॉन्स के लिए इनपुट्स, इनपुट्स + 1 की संख्या (सभी इनपुट्स स्केल २. number) आउटपुट, एकल आउटपुट। क्यू …