পরিসংখ্যান এবং বড় তথ্য

পরিসংখ্যান, মেশিন লার্নিং, ডেটা বিশ্লেষণ, ডেটা মাইনিং এবং ডেটা ভিজ্যুয়ালাইজেশনে আগ্রহী ব্যক্তিদের জন্য প্রশ্নোত্তর

5
রৈখিক প্রতিরোধের জন্য সমকামী ধারণা লঙ্ঘনের বিপদগুলি কী কী?
উদাহরণস্বরূপ, ChickWeightআর-তে থাকা ডেটা সেটটি বিবেচনা করুন time সুস্পষ্টভাবে সময়ের সাথে বিভিন্নতা বৃদ্ধি পায়, তাই যদি আমি একটি সাধারণ লিনিয়ার রিগ্রেশন ব্যবহার করি তবে: m <- lm(weight ~ Time*Diet, data=ChickWeight) আমার প্রশ্নগুলো: মডেলটির কোন দিকটি প্রশ্নবিদ্ধ হবে? সমস্যাগুলি কি Timeসীমার বাইরে এক্সট্রাপোলেটিংয়ের মধ্যে সীমাবদ্ধ ? এই অনুমানের লঙ্ঘনের ক্ষেত্রে লিনিয়ার …

4
দুটি কোভেরিয়েন্স ম্যাট্রিক্সের মধ্যে মিল বা দূরত্বের পরিমাপ
দুটি প্রতিসাম্য কোভেরিয়েন্স ম্যাট্রিক্সের (উভয়ই একই মাত্রা রয়েছে) মধ্যে সাদৃশ্য বা দূরত্বের কোনও ব্যবস্থা আছে কি? আমি এখানে ম্যাট্রিক্স প্রয়োগ ব্যতীত দুটি সম্ভাব্য বন্টন বা ভেক্টরগুলির মধ্যে ইউক্লিডিয়ান দূরত্বের কেএল ডাইভার্জেন্সের এনালগগুলি নিয়ে ভাবছি। আমি ভাবছি সেখানে বেশ কয়েকটি মিলের পরিমাপ হবে। আদর্শভাবে আমি নাল অনুমানটিও পরীক্ষা করতে চাই যে …

3
"স্বতন্ত্র পর্যবেক্ষণ" এর অর্থ কী?
আমি স্বাধীন পর্যবেক্ষণ অনুমানের অর্থ কী তা বোঝার চেষ্টা করছি । কিছু সংজ্ঞা: "দু'টি ইভেন্ট স্বতন্ত্র এবং কেবল যদি " " ( পরিসংখ্যান শর্তাদি অভিধান )পি( a ∩ b ) = পি( ক ) ∗ পি( খ )পি(একটি∩খ)=পি(একটি)*পি(খ)P(a \cap b) = P(a) * P(b) "একটি ইভেন্টের ঘটনা অন্যটির সম্ভাব্যতা পরিবর্তন …

7
একটি স্বেচ্ছাচারিত বিচ্ছিন্ন বিতরণের উপর ভিত্তি করে কীভাবে সংখ্যা উত্পন্ন করা যায়?
আমি কীভাবে একটি স্বেচ্ছাচারিত বিচ্ছিন্ন বিতরণের উপর ভিত্তি করে নম্বর তৈরি করব? উদাহরণস্বরূপ, আমার কাছে সংখ্যার একটি সেট রয়েছে যা আমি উত্পন্ন করতে চাই। বলুন যে তারা নীচের হিসাবে 1-3 থেকে লেবেল করা হয়েছে। 1: 4%, 2: 50%, 3: 46% মূলত, শতাংশগুলি সম্ভাবনা যা তারা এলোমেলো সংখ্যা জেনারেটর থেকে আউটপুট …

1
গুগল প্রেডিকশন এপিআই এর পিছনে কী আছে?
গুগল প্রেডিকশন এপিআই একটি ক্লাউড পরিষেবা যেখানে ব্যবহারকারী কিছু রহস্যময় শ্রেণিবদ্ধকারীকে প্রশিক্ষণের জন্য কিছু প্রশিক্ষণ ডেটা জমা দিতে পারে এবং পরে স্প্যাম ফিল্টারগুলি প্রয়োগ করতে বা ব্যবহারকারীর পছন্দগুলির পূর্বাভাস দেওয়ার জন্য আগত ডেটাগুলিকে শ্রেণিবদ্ধ করতে বলতে পারে। তবে পর্দার আড়ালে কী আছে?

6
কিছু আকর্ষণীয় এবং ভাল লিখিত প্রয়োগ পরিসংখ্যান কাগজপত্র কি কি?
পরিসংখ্যানগুলির প্রয়োগগুলি বর্ণনা করার জন্য কয়েকটি ভাল কাগজপত্রগুলি কী যা মজাদার এবং তথ্য পড়তে আগ্রহী হবে? কেবল স্পষ্ট করে বলতে গেলে, আমি নতুন পরিসংখ্যান পদ্ধতি (উদাহরণস্বরূপ, কমপক্ষে কোণ রিগ্রেশন সম্পর্কিত একটি কাগজ) বর্ণিত কাগজপত্রগুলি খুঁজছি না, বরং বাস্তব-বিশ্ব সমস্যাগুলি কীভাবে সমাধান করবেন সে সম্পর্কে বর্ণিত কাগজপত্রগুলি। উদাহরণস্বরূপ, একটি কাগজ যা …

5
বিভিন্ন "সেরা" মডেলগুলির মধ্যে থেকে সেরা মডেল নির্বাচন করা
বিভিন্ন পদ্ধতি দ্বারা নির্বাচিত বিভিন্ন মডেলগুলির মধ্যে থেকে আপনি কীভাবে একটি মডেল চয়ন করবেন (যেমন পিছনের দিকে বা ফরোয়ার্ড নির্বাচন)? এছাড়াও একটি পার্সিমোনিয়াস মডেল কি?

3
আর এর সাথে বুটস্ট্র্যাপ ব্যবহার করে পি-ভ্যালু গণনা করা হচ্ছে
আমি আনুমানিক 2-পার্শ্বযুক্ত বুটস্ট্র্যাপযুক্ত পি-মানটি গণনা করতে "বুট" প্যাকেজটি ব্যবহার করি তবে ফলাফল টি.স্টেস্টের পি-মান থেকে খুব বেশি দূরে। আমার আর কোডটিতে আমি কী ভুল করেছি তা বুঝতে পারি না। কেউ দয়া করে আমাকে এর জন্য একটি ইঙ্গিত দিতে পারেন time = c(14,18,11,13,18,17,21,9,16,17,14,15, 12,12,14,13,6,18,14,16,10,7,15,10) group=c(rep(1:2, each=12)) sleep = data.frame(time, group) …

6
পাই চার্টে সমস্যা
পাই চার্ট সম্পর্কে ক্রমবর্ধমান আলোচনা হতে পারে বলে মনে হচ্ছে। এর বিরুদ্ধে মূল যুক্তিগুলি মনে হয়: দৈর্ঘ্যের চেয়ে কম শক্তি সহ অঞ্চলটি অনুমিত হয়। পাই চার্টগুলিতে খুব কম ডেটা-পয়েন্ট-টু-পিক্সেল অনুপাত থাকে তবে আমি অনুভব করি যে অনুপাতগুলি চিত্রিত করার সময় এগুলি কোনওভাবে কার্যকর হতে পারে। আমি বেশিরভাগ ক্ষেত্রে একটি টেবিল …

1
একটি হালকা মডেল থেকে প্রভাব পুনরাবৃত্তি
আমি কেবল এই কাগজটি জুড়ে এসেছি , যা মিক্সড ইফেক্টস মডেলিংয়ের মাধ্যমে কোনও পরিমাপের পুনরাবৃত্তিযোগ্যতা (ওরফে বিশ্বাসযোগ্যতা, ওরফে ইন্ট্রাক্লাস পারস্পরিক সম্পর্ক) কীভাবে গণনা করতে হবে তা বর্ণনা করে। আর কোডটি হ'ল: #fit the model fit = lmer(dv~(1|unit),data=my_data) #obtain the variance estimates vc = VarCorr(fit) residual_var = attr(vc,'sc')^2 intercept_var = attr(vc$id,'stddev')[1]^2 …
28 mixed-model  reliability  intraclass-correlation  repeatability  spss  factor-analysis  survey  modeling  cross-validation  error  curve-fitting  mediation  correlation  clustering  sampling  machine-learning  probability  classification  metric  r  project-management  optimization  svm  python  dataset  quality-control  checking  clustering  distributions  anova  factor-analysis  exponential  poisson-distribution  generalized-linear-model  deviance  machine-learning  k-nearest-neighbour  r  hypothesis-testing  t-test  r  variance  levenes-test  bayesian  software  bayesian-network  regression  repeated-measures  least-squares  change-scores  variance  chi-squared  variance  nonlinear-regression  regression-coefficients  multiple-comparisons  p-value  r  statistical-significance  excel  sampling  sample  r  distributions  interpretation  goodness-of-fit  normality-assumption  probability  self-study  distributions  references  theory  time-series  clustering  econometrics  binomial  hypothesis-testing  variance  t-test  paired-comparisons  statistical-significance  ab-test  r  references  hypothesis-testing  t-test  normality-assumption  wilcoxon-mann-whitney  central-limit-theorem  t-test  data-visualization  interactive-visualization  goodness-of-fit 

3
ডেটা বিশ্লেষণে সেরা অনুশীলন সম্পর্কে জানতে গিথুবকে অনুসরণ করবেন কে?
এটি বিশেষজ্ঞদের ডেটা বিশ্লেষণ কোড অধ্যয়ন করতে সহায়ক। আমি সম্প্রতি গিথুব অনুধাবন করছি এবং সেখানে প্রচুর লোকেরা ডেটা বিশ্লেষণ কোড ভাগ করে নিচ্ছেন। এর মধ্যে কয়েকটি আর প্যাকেজ অন্তর্ভুক্ত রয়েছে (যা অবশ্যই সিআরএএন থেকে সরাসরি পাওয়া যায়), তবে পুনরুত্পাদনযোগ্য গবেষণার কয়েকটি উদাহরণ, বিশেষত আর ব্যবহার করে ( গিথুবের এই আর …

4
জিএলএমগুলির জন্য সিউডো আর স্কোয়ার সূত্র
আর, জুলিয়ান জে ফারাওয়ে (পৃষ্ঠা 59) এর সাথে লিনিয়ার মডেল প্রসারিত বইতে আমি সিউডো এর একটি সূত্র পেয়েছি ।R2R2R^2 ।1−ResidualDevianceNullDeviance1−ResidualDevianceNullDeviance1-\frac{\text{ResidualDeviance}}{\text{NullDeviance}} এটি কি জিএলএমগুলির জন্য সিউডো একটি সাধারণ সূত্র ?R2R2R^2


3
আর এর সাথে সময় সিরিজ সম্পর্কে উদাসীন হওয়া
আপনি যদি আবার চিন্তা করেন, কখন আপনি প্রথম সিরিজ বিশ্লেষণ দিয়ে শুরু করেছিলেন। আপনি কি কি সরঞ্জামগুলি, আর প্যাকেজ এবং ইন্টারনেট সংস্থানগুলি সম্পর্কে জানতেন তা চান? আমি যা জিজ্ঞাসা করার চেষ্টা করছি তা হ'ল কোথায় শুরু করা উচিত? বিশেষত, আর এর জন্য এমন কোনও সংস্থান রয়েছে যা আর এর সাথে …
28 r  time-series 

3
আর-তে আলাদা ইউনিফর্ম বিতরণের জন্য ডিফল্ট ফাংশন রয়েছে?
আর এর বেশিরভাগ স্ট্যান্ডার্ড ডিস্ট্রিবিউশনের একটি কমান্ডের পরিবার রয়েছে - পিডিএফ / পিএমএফ, সিডিএফ / সেমিফ, কোয়ান্টাইল, এলোমেলো বিচ্যুতি (উদাহরণস্বরূপ - ডনরম, পনরম, কিউনর্ম, রনরম)। আমি জানি যে বিবিধ ইউনিফর্ম বিতরণগুলির জন্য এই ফাংশনগুলি পুনরুত্পাদন করার জন্য কিছু স্ট্যান্ডার্ড কমান্ড ব্যবহার করা যথেষ্ট সহজ তবে আমি আর অবগত নই যে …

আমাদের সাইট ব্যবহার করে, আপনি স্বীকার করেছেন যে আপনি আমাদের কুকি নীতি এবং গোপনীয়তা নীতিটি পড়েছেন এবং বুঝতে পেরেছেন ।
Licensed under cc by-sa 3.0 with attribution required.