পরিসংখ্যান এবং বড় তথ্য

পরিসংখ্যান, মেশিন লার্নিং, ডেটা বিশ্লেষণ, ডেটা মাইনিং এবং ডেটা ভিজ্যুয়ালাইজেশনে আগ্রহী ব্যক্তিদের জন্য প্রশ্নোত্তর

5
বিরল ঘটনা লজিস্টিক রিগ্রেশন মোকাবেলা করার কৌশল
আমি একটি সীমাবদ্ধ জনসংখ্যার মধ্যে বিরল ঘটনা অধ্যয়ন করতে চাই। যেহেতু আমি কোন কৌশলটি সর্বোত্তমভাবে উপযুক্ত সে সম্পর্কে আমি অনিশ্চিত, তাই আমি এই বিষয়ে সম্পর্কিত টিপস এবং রেফারেন্সগুলির প্রশংসা করব, যদিও আমি এটি ভালভাবে জানি যে এটি মূলত কভার করা হয়েছে। আমি ঠিক জানি না কোথা থেকে শুরু করব। আমার …

4
এসভিএমে কার্নেলের পার্থক্য?
কেউ দয়া করে আমাকে এসভিএমের কার্নেলের মধ্যে পার্থক্য বলতে পারেন: রৈখিক বহুপদ গাউসিয়ান (আরবিএফ) সিগমা কারণ আমরা জানি যে কার্নেলটি আমাদের ইনপুট স্পেসটিকে উচ্চ মাত্রিক বৈশিষ্ট্যযুক্ত স্থানে ম্যাপ করতে ব্যবহৃত হয়। এবং সেই বৈশিষ্ট্য স্পেসে আমরা লিনিয়ারে পৃথক পৃথক সীমানা খুঁজে পাই .. এগুলি কখন ব্যবহৃত হয় (কোন অবস্থার অধীনে) …

7
নাইভ বেয়েসে, যখন পরীক্ষার সেটটিতে আমাদের অজানা শব্দ রয়েছে তখন ল্যাপ্লেস স্মুথ করার জন্য কেন বিরক্ত হন?
আমি আজ নাইভ বেয়েস শ্রেণিবিন্যাসের উপর পড়ছিলাম। আমি পরামিতি অনুমানের শিরোনামে 1 টি স্মুথিং যুক্ত দিয়ে পড়েছি : যাক ccc একটি বর্গ (যেমন ইতিবাচক বা নেতিবাচক হিসেবে) পড়ুন, এবং দিন www একটি টোকেন বা ওয়ার্ড পড়ুন। জন্য সর্বোচ্চ সম্ভাবনা মূল্নির্ধারক P(w|c)P(w|c)P(w|c) হয় count(w,c)count(c)=counts w in class ccounts of words in …

3
মাত্রায় দুটি এলোমেলো ইউনিট ভেক্টরের স্কেলার পণ্য বিতরণ
যদি এবং যদি ( দুটি ইউনিট গোলকের মধ্যে অভিন্নভাবে বিতরণ করা হয়) এ দুটি স্বতন্ত্র এলোমেলো ইউনিট ভেক্টর হয় তবে তাদের স্কেলার পণ্য (বিন্দু পণ্য) the এর বিতরণ কী? ?xx\mathbf{x}yy\mathbf{y}RDRD\mathbb{R}^Dx⋅yx⋅y\mathbf x \cdot \mathbf y আমার ধারণা, দ্রুত বিতরণ সাথে সাথে (?) শূন্য গড়ের সাথে স্বাভাবিক হয়ে যায় এবং উচ্চ মাত্রায় …

4
স্ট্যান্ডার্ড বিচ্যুতি ব্যবহার করে আউটলিয়ারগুলি সনাক্ত করা
এখানে আমার প্রশ্ন অনুসরণ করে , আমি ভাবছি যে আউটলিয়ারগুলি সনাক্ত করার জন্য স্ট্যান্ডার্ড বিচ্যুতি ব্যবহারের পক্ষে বা বিপক্ষে দৃ strong় মতামত রয়েছে কিনা (উদাহরণস্বরূপ যে কোনও ডেটাপয়েন্ট যা 2 টিরও বেশি স্ট্যান্ডার্ড বিচ্যুতি আউটলেটর)। আমি জানি এটি অধ্যয়নের প্রসঙ্গে নির্ভরশীল, উদাহরণস্বরূপ একটি ডাটা পয়েন্ট, 48 কেজি অবশ্যই বাচ্চাদের ওজনের …
27 outliers 

1
মিলের ম্যাট্রিক্সকে (ইউক্লিডিয়ান) দূরত্বের ম্যাট্রিক্সে রূপান্তর করা
র্যান্ডম ফরেস্ট অ্যালগরিদমে, ব্রেইমান (লেখক) নিম্নলিখিত হিসাবে মিলের ম্যাট্রিক্স তৈরি করেছেন: বনের প্রতিটি গাছের নীচে সমস্ত শিক্ষার উদাহরণ প্রেরণ করুন যদি দুটি উদাহরণ একই পাতার বর্ধনের সাথে সামঞ্জস্য মৌলের সাথে মেট্রিক্সে 1 দ্বারা অবতরণ করে গাছের সংখ্যা সহ ম্যাট্রিক্সকে সাধারণ করুন তিনি বলেন: কে এবং কে এবং কেসগুলির মধ্যে সান্নিধ্যগুলি …

2
কে-ভাঁজ ক্রস-বৈধকরণে ভেরিয়েন্সের অনুমান
কে-ভাঁজ ক্রস-বৈধকরণ প্রদত্ত শ্রেণিবদ্ধের সাধারণীকরণের সক্ষমতা অনুমান করতে ব্যবহার করা যেতে পারে। আমি কি (বা আমার উচিত) এর বৈকল্পিকতার আরও ভাল অনুমানের জন্য সমস্ত বৈধতা রানের থেকে পুলের বৈকল্পিকও গণনা করতে পারি? তা না হলে কেন? আমি এমন কাগজপত্র পেয়েছি যা ক্রস-বৈধকরণের জুড়ে পুলের মানক বিচ্যুতি ব্যবহার করে । বৈধতা …

1
সাধারণীকরণ অনুমানের সমীকরণ এবং জিএলএমএম এর মধ্যে পার্থক্য কী?
আমি লগইট লিঙ্কটি ব্যবহার করে 3 স্তরের ভারসাম্যহীন ডেটাতে একটি জিইই চালিয়ে যাচ্ছি। এটি কীভাবে মিশ্রিত প্রভাব (জিএলএমএম) এবং লগইট লিঙ্কের একটি জিএলএম থেকে (ফলাফলটি আমি আঁকতে পারি এবং সহগরের অর্থের পরিপ্রেক্ষিতে) কীভাবে আলাদা? আরও বিশদ: পর্যবেক্ষণগুলি একক বার্নৌল্লি ট্রায়াল। তাদের শ্রেণিকক্ষ এবং বিদ্যালয়ে ক্লাস্টার্ডযুক্ত করা হয়। আর.এস.এস. কে বাদ …

3
ঝকঝকে সবসময় কি ভাল?
মেশিন লার্নিং অ্যালগরিদমগুলির জন্য একটি সাধারণ প্রাক প্রসেসিং পদক্ষেপ হ'ল ডেটা সাদা করা ening দেখে মনে হচ্ছে হোয়াইটিং করা সবসময় ভাল কারণ এটি ডেটা-সংযুক্ত করে মডেলটিকে সহজ করে তোলে। হোয়াইটেনিং করার প্রস্তাব কখন দেওয়া হয় না? দ্রষ্টব্য: আমি ডেটার ডি-পারস্পরিক সম্পর্ক উল্লেখ করছি।

3
স্বাভাবিকতা জন্য আমার কী পরীক্ষা করা উচিত: কাঁচা ডেটা বা অবশিষ্টাংশ?
আমি শিখেছি যে স্বাভাবিকের জন্য আমার অবশ্যই কাঁচা ডেটা নয় বরং তাদের অবশিষ্টাংশের জন্য পরীক্ষা করতে হবে। আমার কি অবশিষ্টাংশ গণনা করা উচিত এবং তারপরে শাপিরো – উইলকের ডাব্লু পরীক্ষা করা উচিত? অবশিষ্টাংশগুলি কি হিসাবে গণনা করা হয়: ?Xi−meanXi−meanX_i - \text{mean} আমার ডেটা এবং ডিজাইনের জন্য দয়া করে এই পূর্ববর্তী …

2
লুপের জন্য ভেরিয়েবলের নামের তালিকা তৈরি করুন, তারপরে তাদের মান নির্ধারণ করুন
আমি অবাক হয়েছি যদি লুপের জন্য একটি ব্যবহার করে ভেরিয়েবলের তালিকা তৈরি করার কোনও সহজ উপায় থাকে এবং এর মান দেয়। for(i in 1:3) { noquote(paste("a",i,sep=""))=i } উপরের কোড, আমি তৈরি করার চেষ্টা a1, a2, a3, 1, 2, 3 তবে আর একটি ত্রুটির বার্তা দেয় যার মান ধার্য করুন। আপনার …
27 r 

5
সেখানে 99 শতাংশ শতাংশ, বা 100 শতাংশ? এবং তারা কি সংখ্যার দল, বা বিভাজক বা পৃথক সংখ্যার দিকে নির্দেশক?
সেখানে 99 শতাংশ শতাংশ, বা 100 শতাংশ? এবং এগুলি কি সংখ্যার গোষ্ঠী, বা বিভাজক লাইন, বা পৃথক সংখ্যার পয়েন্টার? আমি মনে করি একই প্রশ্ন কোয়ার্টাইল বা কোনও কোয়ান্টাইলের জন্য প্রযোজ্য। আমি পড়েছি যে একটি নির্দিষ্ট শতকরা (পি) এ সংখ্যার সূচক, দেওয়া n আইটেমগুলি i = (p / 100) * n …
27 quantiles 

2
বৈকল্পিক এবং গড় স্কোয়ার ত্রুটির মধ্যে পার্থক্য কী?
আমি অবাক হয়েছি এটি আগে জিজ্ঞাসা করা হয়নি, কিন্তু আমি stats.stackexchange এ প্রশ্নটি খুঁজে পাচ্ছি না। এটি সাধারণত বিতরণ করা নমুনার বৈকল্পিক গণনা করার সূত্র: ∑ ( এক্স- এক্স¯)2n - 1Σ(এক্স-এক্স¯)2এন-1\frac{\sum(X - \bar{X}) ^2}{n-1} এটি একটি সাধারণ লিনিয়ার রিগ্রেশনটিতে পর্যবেক্ষণের গড় স্কোয়ার ত্রুটি গণনা করার সূত্র: ∑(yi−y^i)2n−2Σ(Yআমি-Y^আমি)2এন-2\frac{\sum(y_i - \hat{y}_i) ^2}{n-2} …
27 variance  error 

3
যদি কোনও তত্ত্বাবধানে থাকা মেশিন লার্নিং মডেলটি অত্যধিক মানানসই বা না হয় তবে কীভাবে বিচার করবেন?
কেউ যদি আমাকে বলতে পারেন যে কোনও তত্ত্বাবধায়ক মেশিন লার্নিং মডেল অত্যধিক মানানসই বা না থাকে তবে কীভাবে বিচার করবেন? যদি আমার কাছে কোনও বাহ্যিক বৈধতা ডেটাसेट না থাকে তবে আমি জানতে চাই যে আমি ওভারফিটিংয়ের ব্যাখ্যা দিতে 10 গুণ ক্রস বৈধকরণের আরওসি ব্যবহার করতে পারি কিনা। আমার যদি একটি …

4
স্টেশনারি পরীক্ষা এবং ইউনিট রুট পরীক্ষার মধ্যে পার্থক্য কী?
কোয়াটিকোভস্কি – ফিলিপস – শ্মিট – শিন (কেপিএসএস) পরীক্ষা এবং বর্ধিত ডিকি-ফুলার (এডিএফ) পরীক্ষার মধ্যে পার্থক্য কী? তারা কি একই জিনিস পরীক্ষা করছে? না আমাদের বিভিন্ন পরিস্থিতিতে এগুলি ব্যবহার করা দরকার?

আমাদের সাইট ব্যবহার করে, আপনি স্বীকার করেছেন যে আপনি আমাদের কুকি নীতি এবং গোপনীয়তা নীতিটি পড়েছেন এবং বুঝতে পেরেছেন ।
Licensed under cc by-sa 3.0 with attribution required.