পরিসংখ্যান এবং বড় তথ্য

পরিসংখ্যান, মেশিন লার্নিং, ডেটা বিশ্লেষণ, ডেটা মাইনিং এবং ডেটা ভিজ্যুয়ালাইজেশনে আগ্রহী ব্যক্তিদের জন্য প্রশ্নোত্তর

2
সহগের মধ্যে উল্লেখযোগ্য পার্থক্যের জন্য পরীক্ষা করার সঠিক উপায় কী?
আমি আশা করছি যে কেউ আমার জন্য বিভ্রান্তির একটি বিষয় সোজা করতে সহায়তা করতে পারে। বলুন যে আমি নীচের সেটআপ সহ 2 সেট রিগ্রেশন কোফিয়েনটিস একে অপরের থেকে উল্লেখযোগ্যভাবে পৃথক কিনা তা পরীক্ষা করতে চাই: yi=α+βxi+ϵiyi=α+βxi+ϵiy_i = \alpha + \beta x_i + \epsilon_i , 5 টি স্বতন্ত্র ভেরিয়েবল। প্রায় সমান …

2
চি-স্কোয়ার পরীক্ষা কেন প্রত্যাশিত গণনাটিকে বৈকল্পিক হিসাবে ব্যবহার করে?
ইন χ2χ2\chi^2 টেস্টিং, স্বাভাবিক ডিস্ট্রিবিউশন প্রতিটি স্ট্যান্ডার্ড ডেভিয়েশন (অর্থাত প্রত্যাশিত গন্য ভেরিয়ানস হিসাবে) যেমন প্রত্যাশিত গন্য বর্গমূল ব্যবহার করার জন্য ভিত্তি কি? আমি কেবল এই বিষয়ে আলোচনা করতে পেলাম কেবলমাত্র http://www.physics.csbsju.edu/stats/chi-square.html এবং এটি কেবল পোইসন বিতরণের উল্লেখ করেছে। আমার বিভ্রান্তির একটি সাধারণ চিত্র হিসাবে, যদি আমরা পরীক্ষা করে যাচ্ছিলাম যে …

2
বিতরণ যা নেতিবাচক দ্বিপদী বিতরণ ভেরিয়েবলের মধ্যে পার্থক্য বর্ণনা করে?
একটি স্কেল্লাম ডিস্ট্রিবিউশন দুটি ভেরিয়েবলের মধ্যে পার্থক্য বর্ণনা করে যার পোয়েসন বিতরণ রয়েছে। Aণাত্মক দ্বিপদী বিতরণগুলি অনুসরণ করে এমন ভেরিয়েবলের মধ্যে পার্থক্য বর্ণনা করে এমন কি কোনও বিতরণ আছে? আমার ডেটা একটি পোইসন প্রক্রিয়া দ্বারা উত্পাদিত হয়েছে, তবে এতে যথেষ্ট পরিমাণে শব্দ রয়েছে যা বিতরণে অতিরিক্ত পরিমাণে বাড়ে। সুতরাং, negativeণাত্মক …

2
পয়েন্টওয়াইজ মিউচুয়াল তথ্যের সীমানা প্রদত্ত পারস্পরিক তথ্যের সীমানা
ধরুন আমার কাছে দুটি সেট XXX এবং YYY এবং এই সেটগুলি উপর একটি যৌথ সম্ভাব্যতা বিতরণ রয়েছে p(x,y)p(x,y)p(x,y)। যাক p(x)p(x)p(x) এবং p(y)p(y)p(y) উপর প্রান্তিক ডিস্ট্রিবিউশন বোঝাতে XXX এবং YYY যথাক্রমে। XXX এবং মধ্যে পারস্পরিক তথ্যটিকেYYY সংজ্ঞায়িত করা হয়েছে: I(X;Y)=∑x,yp(x,y)⋅log(p(x,y)p(x)p(y))I(X;Y)=∑x,yp(x,y)⋅log⁡(p(x,y)p(x)p(y))I(X; Y) = \sum_{x,y}p(x,y)\cdot\log\left(\frac{p(x,y)}{p(x)p(y)}\right) অর্থাত্ এটি পয়েন্টওয়াইজ মিউচুয়াল ইনফরমেশন পিএমআই ( x …

3
বাউন্ডেড টার্গেট ভেরিয়েবল কীভাবে মডেল করবেন?
আমার 5 টি ভেরিয়েবল রয়েছে এবং আমি আমার টার্গেট ভেরিয়েবলটি পূর্বাভাস দেওয়ার চেষ্টা করছি যা অবশ্যই 0 থেকে 70 এর মধ্যে থাকা উচিত। আমি কীভাবে এই লক্ষ্যটির টুকরোটি আমার লক্ষ্যকে আরও উন্নত করতে মডেল করতে পারি?

4
প্রয়োজনীয় নমুনা আকার গণনা, বৈকল্পিক প্রাক্কলনের নির্ভুলতা?
পটভূমি আমার একটি অজানা বিতরণ সহ একটি পরিবর্তনশীল রয়েছে। আমার কাছে 500 টি নমুনা রয়েছে তবে আমি যে সূক্ষ্মতার সাথে আমি বৈকল্পিক গণনা করতে পারি তা প্রদর্শন করতে চাই, উদাহরণস্বরূপ যে 500 টির একটি নমুনার আকার যথেষ্ট gue আমি ন্যূনতম নমুনার আকার জানার জন্যও আগ্রহী যেটি নির্ভুলতার সাথে বৈকল্পিক অনুমান …

2
জেমস-স্টেইন অনুমানকারী: এফ্রন এবং মরিস কীভাবে তাদের বেসবলের উদাহরণের জন্য সঙ্কোচন
ব্র্যাডলি এফ্রন এবং কার্ল মরিস রচিত "স্ট্যাটিস্টিকসে স্টেইনের প্যারাডক্স" দ্বারা 1977 এর বৈজ্ঞানিক আমেরিকান গবেষণাপত্রে জেমস-স্টেইন সঙ্কোচন ফ্যাক্টর গণনা করার বিষয়ে আমার একটি প্রশ্ন রয়েছে । আমি বেসবল খেলোয়াড়দের জন্য ডেটা সংগ্রহ করেছি এবং এটি নীচে দেওয়া হয়েছে: Name, avg45, avgSeason Clemente, 0.400, 0.346 Robinson, 0.378, 0.298 Howard, 0.356, 0.276 …

5
এ জাতীয় বৃত্তাকার-লিঙ্ক ভিজুয়ালাইজেশন কী বলা হয়?
এই ধরণের চার্টের কোনও নাম আছে? আরও গুরুত্বপূর্ণ বিষয়, আমি এটি নির্মাণ করতে কোন ভিজ্যুয়ালাইজেশন লাইব্রেরি ব্যবহার করতে পারি? http://www.nytimes.com/interactive/2007/12/15/us/politics/DEBATE.html

2
বাউম-ওয়েলচ অ্যালগরিদম এবং ভিটারবি প্রশিক্ষণের মধ্যে পার্থক্য কী?
আমি বর্তমানে একটি চিত্র বিভাজন সমস্যার জন্য ভিটারবি প্রশিক্ষণ ব্যবহার করছি । আমি জানতে চেয়েছিলাম ভিটারবি প্রশিক্ষণের পরিবর্তে বাউম-ওয়েলচ অ্যালগরিদম ব্যবহারের সুবিধা / অসুবিধাগুলি কী।

4
আমি যদি একটি ব্যাখ্যাযোগ্য মডেল চাই, লিনিয়ার রিগ্রেশন ব্যতীত অন্য কোনও পদ্ধতি আছে কি?
আমি এমন কিছু পরিসংখ্যানবিদদের মুখোমুখি হয়েছিল যে পূর্বাভাসের জন্য লিনিয়ার রিগ্রেশন ব্যতীত অন্য মডেলগুলি কখনই ব্যবহার করে না কারণ তারা বিশ্বাস করে যে "এমএল মডেলগুলি" যেমন এলোমেলো বন এবং গ্রেডিয়েন্ট বুস্টিং যেমন "ব্যাখ্যাযোগ্য বা ব্যাখ্যাযোগ্য নয়"। একটি লিনিয়ার রিগ্রেশন-এ, অনুমানের সেটটি যাচাই করা হয়েছে (ত্রুটির স্বাভাবিকতা, সমকামিতা, কোনও বহু-প্রান্তিককরণ নয়), …

2
কেউ আমাকে ইংরেজিতে NUTS ব্যাখ্যা করতে পারেন?
অ্যালগরিদম সম্পর্কে আমার বোঝাটি নিম্নলিখিত: কোনও ইউ-টার্ন স্যাম্পলার (এনইটিএস) হ্যামিলটোনীয় মন্টি কার্লো পদ্ধতি। এর অর্থ এটি কোনও মার্কোভ চেইন পদ্ধতি নয় এবং এইভাবে, এই অ্যালগরিদম এলোমেলো হাঁটার অংশটিকে এড়িয়ে চলে, যা প্রায়শই অক্ষম এবং ধীরে ধীরে ধীরে ধীরে হিসাবে গণ্য হয়। এলোমেলো হাঁটার পরিবর্তে, NUTS এক্স দৈর্ঘ্যের লাফ দেয়। অ্যালগরিদম …

3
পরিসংখ্যান অনুমান করার সময় নিয়মিতকরণ ব্যবহার করা
ভবিষ্যদ্বাণীমূলক মডেলগুলি তৈরি করার সময় আমি নিয়মিতকরণের সুবিধাগুলি সম্পর্কে জানি (পক্ষপাতিত্ব বনাম বৈচিত্র, অত্যধিক মানসিক চাপ প্রতিরোধ করা)। তবে, আমি ভাবছি যে নিয়মিতকরণ (লাসো, রিজ, ইলাস্টিক নেট) করাও যদি ভাল ধারণা হয় তবে যখন রিগ্রেশন মডেলের মূল উদ্দেশ্যটি সহগের উপর নির্ভর করে (যা দেখে ভবিষ্যদ্বাণীকারীরা পরিসংখ্যানগতভাবে তাৎপর্যপূর্ণ)। আমি মানুষের চিন্তাভাবনা …

2
লেমার মডেলের পোস্ট-হক পরীক্ষা কীভাবে করবেন?
এটি আমার ডেটা ফ্রেম: Group <- c("G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3") Subject <- c("S1","S2","S3","S4","S5","S6","S7","S8","S9","S10","S11","S12","S13","S14","S15","S1","S2","S3","S4","S5","S6","S7","S8","S9","S10","S11","S12","S13","S14","S15","S1","S2","S3","S4","S5","S6","S7","S8","S9","S10","S11","S12","S13","S14","S15") Value <- c(9.832217741,13.62390117,13.19671612,14.68552076,9.26683366,11.67886655,14.65083473,12.20969772,11.58494621,13.58474896,12.49053635,10.28208078,12.21945867,12.58276212,15.42648969,9.466436017,11.46582655,10.78725485,10.66159358,10.86701127,12.97863424,12.85276916,8.672953949,10.44587257,13.62135205,13.64038394,12.45778874,8.655142642,10.65925259,13.18336949,11.96595556,13.5552118,11.8337142,14.01763101,11.37502161,14.14801305,13.21640866,9.141392359,11.65848845,14.20350364,14.1829714,11.26202565,11.98431285,13.77216009,11.57303893) data <- data.frame(Group, Subject, Value) তারপরে আমি "মান" -এ 3 গোষ্ঠীর পার্থক্যের তুলনা করতে রৈখিক-মিশ্রিত প্রভাবগুলির মডেলটি চালিত করি, যেখানে "বিষয়" এলোমেলো গুণক: library(lme4) library(lmerTest) model <- lmer (Value~Group + (1|Subject), data = data) summary(model) ফলাফলগুলি হ'ল: …
18 r  lme4-nlme  post-hoc 

1
কে-এনএন গণনা জটিলতা
নির্দোষ অনুসন্ধানের পদ্ধতির (কেডির গাছ বা সিমালার নেই) কে- এনএন অ্যালগরিদমের সময় জটিলতা কী ? হাইপারপ্যারামিটার কে বিবেচনা করে আমি এর সময়ের জটিলতায় আগ্রহী । আমি বিপরীত উত্তর পেয়েছি: ও (এনডি + এনএ), যেখানে এন হ'ল প্রশিক্ষণের সেটগুলির কার্ডিনালিটি এবং প্রতিটি নমুনার মাত্রা ডি । [1] O (ndk), যেখানে আবার …

4
উত্তোলন অপ্টিমাইজেশনে দ্বিতীয়-ক্রম ডেরাইভেটিভস কেন কার্যকর?
আমি অনুমান করি এটি একটি প্রাথমিক প্রশ্ন এবং এটি গ্রেডিয়েন্টের দিকনির্দেশনার সাথেই করতে পারে তবে আমি উদাহরণগুলি সন্ধান করছি যেখানে ২ য় ক্রম পদ্ধতি (যেমন বিএফজিএস ) সাধারণ গ্রেডিয়েন্ট বংশোদ্ভূত থেকে বেশি কার্যকর।

আমাদের সাইট ব্যবহার করে, আপনি স্বীকার করেছেন যে আপনি আমাদের কুকি নীতি এবং গোপনীয়তা নীতিটি পড়েছেন এবং বুঝতে পেরেছেন ।
Licensed under cc by-sa 3.0 with attribution required.