পরিসংখ্যান এবং বড় তথ্য

পরিসংখ্যান, মেশিন লার্নিং, ডেটা বিশ্লেষণ, ডেটা মাইনিং এবং ডেটা ভিজ্যুয়ালাইজেশনে আগ্রহী ব্যক্তিদের জন্য প্রশ্নোত্তর

3
সময় সিরিজে এআইসি বনাম ক্রস বৈধতা: ছোট নমুনা কেস
আমি টাইম সিরিজ সেটিংয়ে মডেল নির্বাচনের বিষয়ে আগ্রহী। সংক্ষিপ্ততার জন্য, ধরুন আমি বিভিন্ন ল্যাগ অর্ডার সহ এআরএমএ মডেলের একটি পুল থেকে একটি এআরএমএ মডেল নির্বাচন করতে চাই। চূড়ান্ত অভিপ্রায় পূর্বাভাস । মডেল নির্বাচন দ্বারা সম্পন্ন করা যেতে পারে ক্রস বৈধতা, তথ্যের মানদণ্ডের ব্যবহার (এআইসি, বিআইসি), অন্যান্য পদ্ধতির মধ্যে। রব জে …

4
আমার ডেটা বিতরণটি প্রতিসম হয় কিনা কীভাবে বলবেন?
আমি জানি যে মাঝারি এবং গড়টি যদি প্রায় সমান হয় তবে এর অর্থ একটি প্রতিসম বন্টন আছে তবে এই বিশেষ ক্ষেত্রে আমি নিশ্চিত নই। গড় এবং মাঝারিটি বেশ কাছাকাছি (কেবলমাত্র 0.487 মি / গল পার্থক্য) যা আমাকে বলতে পারে যে একটি প্রতিসম বন্টন আছে তবে বক্সপ্লটকে দেখে মনে হচ্ছে এটি …

2
কেন উইল্কসের 1938 প্রুফ ভুল বর্ণিত মডেলগুলির জন্য কাজ করে না?
বিখ্যাত 1938 পত্রিকায় (" যৌগিক অনুমানের পরীক্ষার সম্ভাবনা অনুপাতের বৃহত-নমুনা বন্টন ", গাণিতিক পরিসংখ্যানগুলির অ্যানালস, 9: 60-62), স্যামুয়েল উইলস (লগ সম্ভাবনা অনুপাত) এর অ্যাসিম্পোটিক বিতরণ প্রাপ্ত করেছেন নেস্টেড হাইপোথিসিসের জন্য, অনুমানের অধীনে যে বৃহত্তর অনুমানটি সঠিকভাবে নির্দিষ্ট করা হয়েছে। সীমাবদ্ধ বিতরণ হ'ল স্বাধীনতার ডিগ্রি সহ (চি-স্কোয়ার্ড) , যেখানে বৃহত্তর অনুমান …

2
স্বতঃসংশ্লিষ্ট সময়ের সংজ্ঞা (কার্যকর নমুনার আকারের জন্য)
দুর্বল স্থিতিশীল সময় সিরিজের স্বতঃসংশ্লিষ্ট সময়ের জন্য আমি সাহিত্যে দুটি সংজ্ঞা পেয়েছি: τএকটি= 1 + 2 ∑কে = 1∞ρটবনামτখ= 1 + 2 ∑কে = 1∞| ρট|τএকটি=1+ +2Σট=1∞ρটবনামτখ=1+ +2Σট=1∞|ρট| \tau_a = 1+2\sum_{k=1}^\infty \rho_k \quad \text{versus} \quad \tau_b = 1+2\sum_{k=1}^\infty \left|\rho_k\right| যেখানে ল্যাগ এ autocorrelation হয়ট। ρট= কোভ [ এক্সটি, এক্সt + …

2
হার্ড মার্জিন এসভিএম এর ক্ষতির কাজ কী?
লোকে বলেছে নরম মার্জিন এসভিএম হিঞ্জ লস ফাংশনটি ব্যবহার করে: । যাইহোক, আসল উদ্দেশ্য ফাংশন যা নরম মার্জিন এসভিএম হ্রাস করার চেষ্টা করে তা হ'ল rac frac {1} {2} \ | w \ | ^ 2 + C \ Sum_i \ সর্বোচ্চ (0,1-y_i (ডাব্লু ^ x ইন্টারকেল এক্স_আই + বি) …

3
সর্বোচ্চ এন্ট্রপি বিতরণের পরিসংখ্যানীয় ব্যাখ্যা
আমি বিভিন্ন সেটিংসে বেশ কয়েকটি বিতরণের ব্যবহারকে ন্যায়সঙ্গত করতে সর্বোচ্চ এনট্রপির নীতিটি ব্যবহার করেছি; তবে, তথ্য-তাত্ত্বিকের বিপরীতে, সর্বাধিক এনট্রপির ব্যাখ্যা হিসাবে আমি এখনও একটি পরিসংখ্যান তৈরি করতে সক্ষম হতে পারি। অন্য কথায়, এন্ট্রপিটি সর্বাধিকীকরণ কীভাবে বিতরণের পরিসংখ্যানগত বৈশিষ্ট্যগুলি বোঝায়? কেউ কি নিজেকে চালিয়েছেন বা সম্ভবত নিজেকে সর্বোচ্চের একটি পরিসংখ্যানগত ব্যাখ্যা …

2
"পরিসংখ্যান" অর্থ (পরিসংখ্যানের প্রসঙ্গে) কী বোঝায়?
আমি যখন গুগল "fisher" "fiducial" ... আমি নিশ্চিত প্রচুর হিট পেয়েছি তবে আমি অনুসরণ করা সমস্তগুলি আমার বোধগম্য beyond এই সমস্ত হিটগুলির মধ্যে একটি জিনিস মিল রয়েছে বলে মনে হয়: এগুলি সবই রঙ্গিন-ইন-উল-পরিসংখ্যানবিদদের জন্য, তত্ত্ব, অনুশীলন, ইতিহাস এবং পরিসংখ্যানের lদ্ধত্যগুলিতে পুঙ্খানুপুঙ্খভাবে বিস্তৃত লোকদের জন্য লেখা। (অতএব, এই অ্যাকাউন্টগুলির মধ্যে কোনওটিই …

6
প্রশিক্ষণের চেয়ে পরীক্ষার নির্ভুলতা বেশি। কীভাবে ব্যাখ্যা করবেন?
আমার বেশিরভাগ 150 টি উদাহরণ রয়েছে (এমন একটি প্রশিক্ষণ ও পরীক্ষায় বিভক্ত) রয়েছে যেখানে অনেকগুলি বৈশিষ্ট্য (1000 এর চেয়েও বেশি) রয়েছে dat আমার ক্লাসিফায়ারগুলি এবং বৈশিষ্ট্য নির্বাচন পদ্ধতিগুলি তুলনা করতে হবে যা ডেটাতে ভাল সম্পাদন করে। সুতরাং, আমি তিনটি শ্রেণিবদ্ধকরণ পদ্ধতি (জে 48, এনবি, এসভিএম) এবং 2 টি বৈশিষ্ট্য নির্বাচন …

4
গবেষকরা কেন কোনও বৈধতা সেটটিতে পরীক্ষার পরিবর্তে 10-গুণ ক্রস বৈধতা ব্যবহার করবেন?
আমি সেন্টিমেন্ট শ্রেণিবদ্ধকরণ এবং সম্পর্কিত বিষয়গুলি নিয়ে প্রচুর গবেষণা পত্র পড়েছি। তাদের বেশিরভাগ শ্রেণিবদ্ধদের প্রশিক্ষণ এবং পরীক্ষার জন্য 10-গুণ ক্রস বৈধতা ব্যবহার করে। তার অর্থ কোনও পৃথক পরীক্ষা / বৈধকরণ করা হয় না। তা কেন? বিশেষত যারা গবেষণা করছেন তাদের পক্ষে এই পদ্ধতির সুবিধা / অসুবিধাগুলি কী কী?

1
বিচ্ছিন্ন তথ্য সহ কোলমোগোরভ-স্মারনভ: আরগিতে ডিজিওফ :: কেএস.টেস্টের সঠিক ব্যবহার কী?
প্রাথমিক প্রশ্নগুলি: আমি দুটি পরীক্ষামূলক ডেটা সেট একই বন্টন থেকে আসে কিনা তা পরীক্ষা করতে চাই। আমার কাছে কোলমোগোরভ-স্মারনভ পরীক্ষার পরামর্শ দেওয়া হয়েছিল। কনভার্স ( প্রাকটিক্যাল ননপ্যারামেট্রিক স্ট্যাটিস্টিকস , 3 ডি) বলে মনে হচ্ছে যে কলমোগোরভ-স্মারনভ পরীক্ষা এই উদ্দেশ্যে ব্যবহার করা যেতে পারে তবে এর আচরণটি বিচ্ছিন্ন বিতরণ সহ "রক্ষণশীল" …

2
মাল্টিভারিয়েট রিগ্রেশনের জন্য এলোমেলো বন
ইনপুট বৈশিষ্ট্য এবং আউটপুটগুলির সাথে আমার একাধিক আউটপুট রিগ্রেশন সমস্যা রয়েছে । আউটপুটগুলির একটি জটিল, অ-রৈখিক পারস্পরিক সম্পর্ক কাঠামো রয়েছে।ঘএক্সঘএক্সd_xঘYঘYd_y রিগ্রেশন করতে আমি এলোমেলো বন ব্যবহার করতে চাই। যতদূর আমি বলতে পারি, রিগ্রেশনের জন্য এলোমেলো বনগুলি কেবল একটি একক আউটপুট নিয়ে কাজ করে, তাই আমাকে র্যান্ডম বনগুলি - প্রতিটি আউটপুটের …

3
এআইসি এবং বিআইসি নম্বর ব্যাখ্যা
আমি কীভাবে এআইসি (আকাইকে তথ্য মানদণ্ড) এবং বিআইসির (বায়সিয়ান তথ্য মাপদণ্ড) অনুমানের ব্যাখ্যা করতে পারি তার উদাহরণগুলি সন্ধান করছি। বিআইসি-র মধ্যে নেতিবাচক পার্থক্যকে অন্য মডেলের একের পরের মতভেদ হিসাবে ব্যাখ্যা করা যেতে পারে? আমি কীভাবে এটি কথায় বলতে পারি? উদাহরণস্বরূপ সাথে BIC = -2 পরোক্ষভাবে পারে যে অন্যান্য মডেল উপর …

4
পিসিএর জন্য অনুপস্থিত মানগুলির অনুদান utation
আমি আর- prcomp()তে একটি পিসিএ (মূল উপাদান বিশ্লেষণ) সম্পাদন করতে ফাংশনটি ব্যবহার করেছি However তবে, সেই ফাংশনে একটি বাগ রয়েছে যাতে na.actionপ্যারামিটারটি কাজ করে না। আমি স্ট্যাকওভারফ্লোতে সহায়তা চেয়েছি ; সেখানে দুইজন ব্যবহারকারী NAমূল্যবোধের সাথে আচরণ করার দুটি পৃথক উপায়ে প্রস্তাব করেছিলেন । যাইহোক, উভয় সমাধানের সাথে সমস্যাটি হ'ল যখন …

1
আর এ প্রাকৃতিক কিউবিক স্প্লাইনে নট সেট করা
আমার অনেকগুলি সম্পর্কযুক্ত বৈশিষ্ট্যযুক্ত ডেটা রয়েছে এবং আমি এলডিএ চালানোর আগে মসৃণ ভিত্তিতে ফাংশন দিয়ে বৈশিষ্ট্যগুলি হ্রাস করে শুরু করতে চাই। আমি ফাংশন splinesসহ প্যাকেজে প্রাকৃতিক কিউবিক স্প্লাইনগুলি ব্যবহার করার চেষ্টা করছি ns। আমি গিঁটগুলি বরাদ্দের বিষয়ে কীভাবে যেতে পারি? এখানে বেসিক আর কোড রয়েছে: library(splines) lda.pred <- lda(y ~ …
23 r  splines 

3
বায়েসের উপপাদ্যটিতে কেন ডিনোমিনেটর ভেঙে ফেলা হবে?
(আমি পরিসংখ্যানের ক্ষেত্রে একজন নবাগত I'm আমি একজন গণিতবিদ এবং একজন প্রোগ্রামার এবং আমি নিষ্পাপ বায়েশিয়ান স্প্যাম ফিল্টারের মতো কিছু তৈরি করার চেষ্টা করছি)) আমি অনেক জায়গায় লক্ষ্য করেছি যে লোকেরা বাইসের উপপাদ্য থেকে সমীকরণে ডিনোমিনেটরকে ভেঙে ফেলার প্রবণতা রয়েছে। সুতরাং এর পরিবর্তে: পি( ক | খ ) ⋅ পি( …
23 bayesian 

আমাদের সাইট ব্যবহার করে, আপনি স্বীকার করেছেন যে আপনি আমাদের কুকি নীতি এবং গোপনীয়তা নীতিটি পড়েছেন এবং বুঝতে পেরেছেন ।
Licensed under cc by-sa 3.0 with attribution required.