পরিসংখ্যান এবং বড় তথ্য

পরিসংখ্যান, মেশিন লার্নিং, ডেটা বিশ্লেষণ, ডেটা মাইনিং এবং ডেটা ভিজ্যুয়ালাইজেশনে আগ্রহী ব্যক্তিদের জন্য প্রশ্নোত্তর

5
পিসিএর উদাহরণ যেখানে কম বৈচিত্র সহ পিসিগুলি "দরকারী"
সাধারণত অধ্যক্ষ উপাদান বিশ্লেষণে (পিসিএ) প্রথম কয়েকটি পিসি ব্যবহার করা হয় এবং কম ভেরিয়েন্স পিসি বাদ দেওয়া হয়, কারণ তারা ডেটাগুলির মধ্যে তারতম্যের খুব বেশি ব্যাখ্যা করে না। যাইহোক, এমন কোনও উদাহরণ রয়েছে যেখানে নিম্ন প্রকরণের পিসিগুলি দরকারী (যেমন তথ্যগুলির প্রসঙ্গে ব্যবহার করতে পারে, একটি স্বজ্ঞাত ব্যাখ্যা আছে ইত্যাদি) এবং …
24 pca 

2
প্রত্যাশা সর্বাধিকতা অ্যালগরিদম কেন স্থানীয় সর্বোত্তম রূপান্তরিত করার গ্যারান্টিযুক্ত?
আমি ইএম অ্যালগরিদমের কয়েকটি ব্যাখ্যা পড়েছি (যেমন বিশপের প্যাটার্ন রিকগনিশন এবং মেশিন লার্নিং এবং মেশিন লার্নিংয়ের উপর রজার এবং গেরোমালি ফার্স্ট কোর্স থেকে)। EM এর ব্যয় ঠিক আছে, আমি এটি বুঝতে পারি। আমি এও বুঝতে পারি কেন অ্যালগরিদম কেন কিছুতে আবৃত থাকে: প্রতিটি পদক্ষেপে আমরা ফলাফলটি উন্নত করি এবং সম্ভাবনাটি …


5
একটি মিশ্র মডেলটিতে কোনও ফ্যাক্টরকে এলোমেলো হিসাবে বিবেচনা করার উল্টো দিকটি কী?
মডেল ফ্যাক্টরটিকে কয়েকটি কারণে এলোমেলো হিসাবে লেবেল করার সুবিধা গ্রহণ করার ক্ষেত্রে আমার সমস্যা আছে। আমার কাছে এটি প্রায় সমস্ত ক্ষেত্রে দেখা যায় যে সর্বোত্তম সমাধানটি সমস্ত কারণকে স্থির হিসাবে বিবেচনা করা। প্রথমত, স্থির বনাম র্যান্ডম এর পার্থক্যটি বেশ স্বেচ্ছাসেবী। স্ট্যান্ডার্ড ব্যাখ্যাটি হ'ল, যদি কেউ সে প্রতি নির্দিষ্ট পরীক্ষামূলক ইউনিটগুলিতে …

4
শাপিরো – উইলক সেরা নরমালারি পরীক্ষা? কেন এটি অ্যান্ডারসন-ডার্লিংয়ের মতো অন্যান্য পরীক্ষাগুলির চেয়ে ভাল হতে পারে?
আমি কোথাও সাহিত্যে পড়েছি যে শাপিরো – উইলক পরীক্ষাটি সেরা স্বাভাবিকতা পরীক্ষা হিসাবে বিবেচিত হয় কারণ একটি নির্দিষ্ট তাৎপর্য স্তরের জন্য, , নাল অনুমানটিকে প্রত্যাখ্যান করার সম্ভাবনা যদি অন্যের তুলনায় উচ্চতর হয় স্বাভাবিকতা পরীক্ষা।αα\alpha আপনি যদি দয়া করে সম্ভব গাণিতিক যুক্তি ব্যবহার করে আমাকে ব্যাখ্যা করতে পারেন তবে অন্যান্য স্বাভাবিকতার …

3
শ্রেণিবিন্যাসের পারফরম্যান্স মূল্যায়নের জন্য ক্রস-বৈধতা বা বুটস্ট্র্যাপিং?
কোনও নির্দিষ্ট ডেটা সেটে শ্রেণিবদ্ধের পারফরম্যান্স মূল্যায়ন করার জন্য এবং অন্যান্য শ্রেণিবদ্ধের সাথে এটির তুলনা করার জন্য স্যাম্পলিংয়ের সবচেয়ে উপযুক্ত পদ্ধতি কী? ক্রস-বৈধকরণটি স্ট্যান্ডার্ড অনুশীলন বলে মনে হয় তবে আমি পড়েছি যে .632 বুটস্ট্র্যাপের মতো পদ্ধতিগুলি আরও ভাল পছন্দ। ফলোআপ হিসাবে: পারফরম্যান্স মেট্রিকের পছন্দটি কি উত্তরকে প্রভাবিত করে (যদি আমি …

2
বেঁচে থাকার বিশ্লেষণে, কেন আমরা সম্পূর্ণ প্যারামেট্রিক মডেলের পরিবর্তে আধা-প্যারামেট্রিক মডেল (কক্স আনুপাতিক বিপত্তি) ব্যবহার করব?
এই প্রশ্নটি গণিত স্ট্যাক এক্সচেঞ্জ থেকে স্থানান্তরিত হয়েছিল কারণ ক্রস ভ্যালিডেটে উত্তর দেওয়া যেতে পারে। 6 বছর আগে স্থানান্তরিত । আমি কক্স প্রোপোরেন্টাল হ্যাজার্ডস মডেলটি অধ্যয়ন করছি এবং বেশিরভাগ পাঠ্যে এই প্রশ্নটি সমালোচিত। কক্স আংশিক সম্ভাবনা পদ্ধতি ব্যবহার করে হ্যাজার্ড ফাংশনের সহগকে ফিট করার প্রস্তাব করেছিল, তবে কেন সর্বাধিক সম্ভাবনা …

4
সত্য ধনাত্মক, মিথ্যা নেতিবাচক হার দেওয়া, আপনি কি মিথ্যা ধনাত্মক, সত্য নেতিবাচক গণনা করতে পারেন?
আমার জন্য নিম্নোক্ত মূল্য আছে True Positive (TP)এবং False Negative (FN)নিম্নরূপ: TP = 0.25 FN = 0.75 এই মানগুলি থেকে, আমরা গণনা করতে পারি False Positive (FP)এবং True Negative (TN)?

3
ডাটাবেস থেকে 1 ডি ডেটার বিভিন্ন ক্লাস্টার নির্ধারণ করুন
আমার কাছে বিভিন্ন নোডের মধ্যে ডেটা স্থানান্তরের একটি ডাটাবেস টেবিল রয়েছে। এটি একটি বিশাল ডাটাবেস (প্রায় ৪০ মিলিয়ন ট্রান্সফার সহ)। বৈশিষ্ট্যগুলির মধ্যে একটি হ'ল বাইট (এনবিটস) স্থানান্তর সংখ্যা যা 0 বাইট থেকে 2 টি টেরা বাইট পর্যন্ত হয়। আমি এনবিটিসকে যেমন ক্লাস্টার দিতে চাই যে কে ক্লাস্টার দিয়েছে কিছু এক্স …

2
কত বড় একটি প্রশিক্ষণ সেট প্রয়োজন?
কোনও শ্রেণিবদ্ধ (এই ক্ষেত্রে একটি এলডিএ) প্রশিক্ষণের জন্য কত প্রশিক্ষণের নমুনার প্রয়োজন তা নির্ধারণ করার জন্য একটি সাধারণ পদ্ধতি ব্যবহার করা হয় কি না সর্বনিম্ন প্রান্তিক সাধারণীকরণের সঠিকতা পেতে? আমি জিজ্ঞাসা করছি কারণ আমি সাধারণত ব্রেইন-কম্পিউটার ইন্টারফেসে প্রয়োজনীয় ক্যালিগ্রেশন সময়টি হ্রাস করতে চাই।

2
রিগ্রেশন এর জন্য কীভাবে একটি অসম্পূর্ণ ক্ষতি ফাংশন ডিজাইন এবং প্রয়োগ করতে হবে?
সমস্যা রিগ্রেশনে সাধারণত কোনও নমুনার জন্য গড় স্কোয়ার ত্রুটি (এমএসই) গণনা করা হয় : একটি ভবিষ্যদ্বাণীকের গুণমান পরিমাপ করতে।এমএসই = 1এনΣi = 1এন( ছ( এক্সআমি) - ছˆ( এক্সআমি) )2MSE=1n∑i=1n(g(xi)−g^(xi))2 \text{MSE} = \frac{1}{n} \sum_{i=1}^n\left(g(x_i) - \widehat{g}(x_i)\right)^2 এই মুহুর্তে আমি একটি রিগ্রেশন সমস্যা নিয়ে কাজ করছি যেখানে লক্ষ্য নির্ধারণ করা মূল্যের মূল্য …

1
গ্রেডিয়েন্ট বংশোদ্ভূত অবসানের শর্তটিকে কীভাবে সংজ্ঞায়িত করবেন?
আসলে, আমি আপনাকে জিজ্ঞাসা করতে চেয়েছিলাম যে আমি গ্রেডিয়েন্ট বংশোদ্ভূত হওয়ার জন্য কীভাবে স্থায়ী শর্তটি সংজ্ঞায়িত করতে পারি। আমি কি পুনরাবৃত্তির সংখ্যার উপর ভিত্তি করে এটি থামাতে পারি, অর্থাৎ 100 টি পুনরাবৃত্তির জন্য প্যারামিটারের মান বিবেচনা করে? বা আমার কি এমন অপেক্ষা করা উচিত যে দুটি নতুন প্যারামিটারের মান 'নতুন' …

1
লিনিয়ার রিগ্রেশন প্রেডিকশন ইন্টারভাল
যদি আমার ডাটা পয়েন্টগুলির মধ্যে সর্বোত্তম রৈখিক আনুমানিকতা (সর্বনিম্ন স্কোয়ার ব্যবহার করে) লাইন হয় তবে আমি কীভাবে আনুমানিক ত্রুটি গণনা করতে পারি? যদি আমি পর্যবেক্ষণ এবং পূর্বাভাসগুলির মধ্যে পার্থক্যগুলির স্ট্যান্ডার্ড বিচ্যুতি গণনা করি , তবে আমি পরে বলতে পারি যে একটি বাস্তব (তবে পর্যবেক্ষণ করা হয়নি) মান অন্তর অন্তর্গত ( …

5
নমুনাগুলি বিতরণ যখন স্বাভাবিক হয় না তখন স্বাধীন নমুনাগুলির টি-পরীক্ষা কতটা শক্ত?
আমি পড়েছি যে T -test হল "যুক্তিসঙ্গতভাবে শক্তসমর্থ" যখন নমুনার ডিস্ট্রিবিউশন স্বাভাবিক থেকে প্রস্থান। অবশ্যই, এটি গুরুত্বপূর্ণ যে পার্থক্যগুলির নমুনা বিতরণ। আমার কাছে দুটি গ্রুপের ডেটা রয়েছে। গ্রুপগুলির মধ্যে একটি নির্ভরশীল ভেরিয়েবলের উপর অত্যন্ত স্কিউড। উভয় দলের জন্য নমুনার আকার বেশ ছোট (একটিতে n = 33 এবং অন্যটিতে 45)। আমি …

1
কীভাবে একটি বিরাট স্পার্স কন্টিনজেন্সি টেবিলটি কল্পনা করা যায়?
আমার দুটি ভেরিয়েবল রয়েছে: ড্রাগ নেম (ডিএন) এবং সংশ্লিষ্ট অ্যাডওয়ার্স ইভেন্টস (এই), যা বহু-বহু-সম্পর্কের মধ্যে দাঁড়িয়ে। 33,556 ড্রাগ নাম এবং 9,516 বিরূপ ইভেন্ট রয়েছে। নমুনা আকার প্রায় 5.8 মিলিয়ন পর্যবেক্ষণ। আমি ডিএন এবং এই এর মধ্যে সমিতি / সম্পর্ক অধ্যয়ন করতে এবং বুঝতে চাই। আমি আর এই সেটটি ভিজ্যুয়ালাইজ করার …

আমাদের সাইট ব্যবহার করে, আপনি স্বীকার করেছেন যে আপনি আমাদের কুকি নীতি এবং গোপনীয়তা নীতিটি পড়েছেন এবং বুঝতে পেরেছেন ।
Licensed under cc by-sa 3.0 with attribution required.