পরিসংখ্যান এবং বড় তথ্য

পরিসংখ্যান, মেশিন লার্নিং, ডেটা বিশ্লেষণ, ডেটা মাইনিং এবং ডেটা ভিজ্যুয়ালাইজেশনে আগ্রহী ব্যক্তিদের জন্য প্রশ্নোত্তর

4
উইনসোরাইজিং বনাম ট্রিমিং ডেটা সম্পর্কিত তুলনামূলক গুণাবলী কী?
ডেটা উইনসরাইজ করার অর্থ প্রতিটি প্রান্ত থেকে নির্দিষ্ট পারসেন্টাইল মান সহ একটি ডেটা সেটের চূড়ান্ত মানগুলি প্রতিস্থাপন করা হয়, যখন ট্রিমিং বা ট্রান্সকাটিংয়ের সাথে সেই চূড়ান্ত মানগুলি সরানো থাকে । আমি সর্বদা গড় বা মানক বিচ্যুতি হিসাবে পরিসংখ্যান গণনা করার সময় বহিরাগতদের প্রভাবকে হ্রাস করার জন্য একটি কার্যকর বিকল্প হিসাবে …

4
নিম্ন পি-মানগুলি শূন্যের বিরুদ্ধে আরও প্রমাণ নয় কেন? জোহানসন ২০১১ এর তর্ক
জোহানসন (২০১১) " অসম্ভবকে শৃঙ্খলাবদ্ধ করুন: পি-মান, প্রমাণ এবং সম্ভাবনা " (এখানে জার্নালের লিঙ্কও রয়েছে ) উল্লেখ করেছে যে নীচের মূল্যগুলি প্রায়শই শূন্যতার বিরুদ্ধে শক্তিশালী প্রমাণ হিসাবে বিবেচিত হয়। জোহানসন ইঙ্গিত দিয়েছিল যে লোকেরা যদি পরিসংখ্যানগত পরীক্ষায় ০.০১ এর পি- ভ্যালু আউটপুট করে , তবে তাদের পরিসংখ্যানগত পরীক্ষার ০.৪৫ এর …


2
একটি 'পি-মান' এর সঠিক মানটি কি অর্থহীন?
২০০৯ সালে আমি একটি পরিসংখ্যানবিদদের সাথে ফিরে আলোচনা করেছি যেখানে তিনি বলেছিলেন যে পি-মানটির সঠিক মূল্যটি অপ্রাসঙ্গিক: কেবলমাত্র এটি গুরুত্বপূর্ণ যে তা গুরুত্বপূর্ণ বা তা গুরুত্বপূর্ণ নয় is অর্থাৎ একটি ফলাফল অন্যটির চেয়ে তাত্পর্যপূর্ণ হতে পারে না; উদাহরণস্বরূপ আপনার নমুনাগুলি হয় একই জনসংখ্যা থেকে আসে বা না হয়। এর সাথে …

2
"ডিপ লার্নিং" এবং মাল্টিলেভেল / শ্রেণিবদ্ধ মডেলিংয়ের মধ্যে পার্থক্য কী?
মাল্টিলেভেল / হায়ারার্কিকাল মডেলিংয়ের জন্য কি "গভীর শিক্ষা" কি অন্য একটি শব্দ? আমি পূর্বের তুলনায় অনেক বেশি পরিচিত, তবে আমি যা বলতে পারি তা থেকে প্রাথমিক পার্থক্যটি তাদের সংজ্ঞায় নেই, তবে কীভাবে তারা তাদের অ্যাপ্লিকেশন ডোমেনের মধ্যে ব্যবহার এবং মূল্যায়ন করা হয়। দেখে মনে হচ্ছে সাধারণত একটি "ডিপ লার্নিং" অ্যাপ্লিকেশনটিতে …

1
নেতিবাচক দ্বিপদী রিগ্রেশন প্রশ্ন - এটি একটি দরিদ্র মডেল?
আমি গণনা ডেটার জন্য রিগ্রেশন মডেলগুলিতে বিক্রয়কারী এবং শমুয়েলির একটি খুব আকর্ষণীয় নিবন্ধ পড়ছি am শুরুর দিকে (পৃষ্ঠা 944) তারা ম্যাককুল্লাওহ এবং নেল্ডারকে (1989) উদ্ধৃত করে বলেছে যে নেতিবাচক দ্বিপদী রিগ্রেশন অপ্রচলিত এবং সমস্যাযুক্ত ক্যানোনিকাল লিঙ্ক রয়েছে। আমি উল্লিখিত প্যাসেজটি পেয়েছি এবং এটিতে বলা হয়েছে (এম এবং এন এর 374 …

1
জিবিএম পরামিতিগুলির জন্য কিছু দরকারী নির্দেশিকা কী কী?
জিবিএম ব্যবহার করে প্যারামিটারগুলি পরীক্ষা করার জন্য (যেমন ইন্টারঅ্যাকশন গভীরতা, মিনিচাইল্ড, স্যাম্পল রেট ইত্যাদি) কিছু দরকারী নির্দেশিকা কী? ধরা যাক আমার কাছে 70-100 বৈশিষ্ট্য রয়েছে, 200,000 জনসংখ্যা রয়েছে এবং আমি 3 এবং 4 এর আন্তঃসংযোগ গভীরতার পরীক্ষা করার ইচ্ছা নিয়েছি যে স্পষ্টতই পরামিতিগুলির সংমিশ্রণটি নমুনা ছাড়াই সেরা পরীক্ষা করে দেখার …

5
লাইন প্লটের জন্য রঙ এবং লাইন বেধের প্রস্তাবনা
মানচিত্র, বহুভুজ এবং ছায়াযুক্ত অঞ্চলগুলির জন্য রঙিন অন্ধ-বান্ধব রঙ পছন্দ সম্পর্কে অনেক কিছু লেখা হয়েছে (উদাহরণস্বরূপ http://colorbrewer2.org দেখুন )। আমি লাইন বর্ণগুলির জন্য লাইনের রঙ এবং বিভিন্ন লাইন বেধের জন্য সুপারিশগুলি খুঁজে পাইনি। লক্ষ্যগুলি হ'ল: সহজেই লাইনগুলি আলাদা করা যায় এমনকি যখন তারা মিশে যায় বর্ণ অন্ধত্বের সবচেয়ে সাধারণ ফর্মগুলির …

5
অনেকগুলি স্বাধীন ভেরিয়েবলের মধ্যে উল্লেখযোগ্য ভবিষ্যদ্বাণীকারী সনাক্ত করা te
দুটি অ-ওভারল্যাপিং জনসংখ্যার ডেটাসেটে (রোগী এবং স্বাস্থ্যকর, মোট ) আমি ক্রমাগত নির্ভরশীল ভেরিয়েবলের জন্য ( স্বতন্ত্র ভেরিয়েবলগুলির মধ্যে) উল্লেখযোগ্য ভবিষ্যদ্বাণী খুঁজে পেতে চাই । ভবিষ্যদ্বাণীকারীদের মধ্যে সম্পর্ক রয়েছে। ভবিষ্যদ্বাণীকারীদের মধ্যে কোনও নির্ভরশীল পরিবর্তনশীল "বাস্তবতার সাথে" সম্পর্কিত (নির্ভরশীল ভেরিয়েবলের যথাসম্ভব যথাযথ ভবিষ্যদ্বাণী করার চেয়ে) এর সাথে সম্পর্কিত কিনা তা অনুসন্ধানে আমি …

1
একটি বিশাল, স্পার্স ম্যাট্রিক্সের উপর মাত্রা হ্রাস (এসভিডি বা পিসিএ)
/ সম্পাদনা: আরও অনুসরণ করুন এখন আপনি irlba :: prcomp_irlba ব্যবহার করতে পারেন / সম্পাদনা: আমার নিজের পোস্টে অনুসরণ করা। irlbaএখন "কেন্দ্র" এবং "স্কেল" আর্গুমেন্ট রয়েছে, যা আপনাকে নীতি উপাদানগুলি গণনা করতে এটি ব্যবহার করতে দেয়, যেমন: pc <- M %*% irlba(M, nv=5, nu=0, center=colMeans(M), right_only=TRUE)$v আমার কাছে একটি Matrixমেশিন …

4
জটিল তথ্য নিয়ে বিশ্লেষণ, আলাদা কিছু?
উদাহরণস্বরূপ বলুন আপনি লিনিয়ার মডেল করছেন, তবে ডেটা জটিল।yyy y=xβ+ϵy=xβ+ϵ y = x \beta + \epsilon আমার ডেটা সেট জটিল, যেমন তে সমস্ত সংখ্যা ফর্মের । এই জাতীয় ডেটা নিয়ে কাজ করার সময় কি পদ্ধতিগতভাবে আলাদা কিছু আছে?yyy(a+bi)(a+bi)(a + bi) আমি জিজ্ঞাসা করছি কারণ, আপনি জটিল কোভেরিয়েন্স ম্যাট্রিক্স এবং পরীক্ষার …

5
"গড় মান" এবং "গড়" এর মধ্যে পার্থক্য কী?
উইকিপিডিয়া ব্যাখ্যা: একটি ডেটা সেট করার জন্য, গড়টি হ'ল সংখ্যার দ্বারা বিভক্ত মানগুলির যোগফল। এই সংজ্ঞাটি যদিও আমি "গড়" বলি তার সাথে মিলে যায় (কমপক্ষে সেটাই আমি শেখা মনে করি)। তবুও উইকিপিডিয়া আরও একবার উদ্ধৃতি: অন্যান্য পরিসংখ্যানগত ব্যবস্থা রয়েছে যা নমুনাগুলি ব্যবহার করে যেগুলি কিছু লোক গড়ের সাথে বিভ্রান্ত করে …

3
শালিজির বেইসিয়ান সময়ের প্যারাডক্সের পিছনের তীরের এন্ট্রপি ভিত্তিক খ্যাতি?
ইন এই কাগজ , প্রতিভাবান গবেষক Cosma Shalizi যুক্তি সম্পূর্ণরূপে একটি বিষয়ী Bayesian দৃশ্য গ্রহণ করতে, এক একটি unphysical ফলে সময় তীর (এনট্রপি প্রবাহ কর্তৃক প্রদত্ত) প্রকৃতপক্ষে যেতে হবে স্বীকার করতে হবে যে পিছন । এটি মূলত ইটি জেনেসের দ্বারা প্রকাশিত এবং জনপ্রিয় হওয়া সর্বাধিক এনট্রপি / সম্পূর্ণ ব্যক্তিগত বায়েশিয়ান …

8
গড়ের সাথে আউটলিয়ারদের প্রতিস্থাপন করা
এই প্রশ্নটি আমার বন্ধু জিজ্ঞাসা করেছিলেন যিনি ইন্টারনেট সম্পর্কে জ্ঞান নন। আমার কোনও পরিসংখ্যানের পটভূমি নেই এবং আমি এই প্রশ্নের জন্য ইন্টারনেট ঘুরে দেখছি। প্রশ্নটি হল: আউটলিয়ারদের কি গড় মূল্য দিয়ে প্রতিস্থাপন করা সম্ভব? যদি এটি সম্ভব হয় তবে এই বিবৃতিটি ব্যাকআপ করার জন্য কোনও বইয়ের রেফারেন্স / জার্নাল রয়েছে …

3
পরিবর্তনশীল নির্বাচন কেন প্রয়োজনীয়?
সাধারণ তথ্য-ভিত্তিক ভেরিয়েবল নির্বাচন পদ্ধতি (উদাহরণস্বরূপ, এগিয়ে, পিছিয়ে, ধাপে ধাপে, সমস্ত উপসর্গ) অনাকাঙ্ক্ষিত বৈশিষ্ট্যযুক্ত মডেল উত্পাদন করতে ঝোঁক থাকে: গুণাগুণগুলি শূন্য থেকে দূরে রয়েছে। স্ট্যান্ডার্ড ত্রুটিগুলি যা খুব ছোট এবং আত্মবিশ্বাসের ব্যবধানগুলি খুব সংকীর্ণ। পরীক্ষার পরিসংখ্যান এবং পি-মানগুলির বিজ্ঞাপনী অর্থ নেই। মডেল ফিটের প্রাক্কলন যা অত্যধিক আশাবাদী। অর্থহীন হতে পারে …

আমাদের সাইট ব্যবহার করে, আপনি স্বীকার করেছেন যে আপনি আমাদের কুকি নীতি এবং গোপনীয়তা নীতিটি পড়েছেন এবং বুঝতে পেরেছেন ।
Licensed under cc by-sa 3.0 with attribution required.