পরিসংখ্যান এবং বড় তথ্য

পরিসংখ্যান, মেশিন লার্নিং, ডেটা বিশ্লেষণ, ডেটা মাইনিং এবং ডেটা ভিজ্যুয়ালাইজেশনে আগ্রহী ব্যক্তিদের জন্য প্রশ্নোত্তর

5
রিগ্রেশনে ভারসাম্যহীন ডেটার জন্য নমুনা
শ্রেণিবদ্ধকরণ প্রসঙ্গে ভারসাম্যহীন ডেটা পরিচালনা করার বিষয়ে ভাল প্রশ্ন রয়েছে , তবে আমি ভাবছি যে লোকেরা রিগ্রেশনের জন্য নমুনা দেওয়ার জন্য কী করে। সমস্যা ডোমেনটি লক্ষণটির প্রতি খুব সংবেদনশীল তবে লক্ষ্যমাত্রার মাত্রায় কিছুটা সংবেদনশীল বলুন। তবে তাত্পর্যটি যথেষ্ট গুরুত্বপূর্ণ যে মডেলটি রিগ্রেশন হওয়া উচিত (ধারাবাহিক লক্ষ্য) শ্রেণিবিন্যাস নয় (ইতিবাচক বনাম …

6
ছোট নমুনাগুলির জন্য উপযুক্ত স্বাভাবিকতা পরীক্ষা
এখনও অবধি, আমি ছোট নমুনায় স্বাভাবিকতা অনুমানগুলি পরীক্ষা করার জন্য শাপিরো-উইলকের পরিসংখ্যানটি ব্যবহার করছি। আপনি দয়া করে অন্য কৌশল প্রস্তাব করতে পারেন?

5
বেয়েসের উপপাদ্য অন্তর্দৃষ্টি
আমি পূর্ব , উত্তরোত্তর , সম্ভাবনা এবং প্রান্তিক সম্ভাবনার দিক দিয়ে বয়েসের উপপাদ্য সম্পর্কে অন্তর্দৃষ্টি ভিত্তিক বোঝার বিকাশের চেষ্টা করছি । তার জন্য আমি নিম্নলিখিত সমীকরণটি ব্যবহার করি: যেখানে একটি অনুমান বা বিশ্বাসকে উপস্থাপন করে এবং তথ্য বা প্রমাণকে উপস্থাপন করে। আমি ধারণা বোঝা থাকেন অবর - এটি একটি ঐক্যবদ্ধ …

4
ডিপ লার্নিং মডেলগুলির জন্য কেন সফটম্যাক্স আউটপুট একটি ভাল অনিশ্চয়তা পরিমাপ নয়?
আমি বেশ কিছু সময়ের জন্য কনভলিউশনাল নিউরাল নেটওয়ার্কস (সিএনএন) এর সাথে কাজ করছি, বেশিরভাগ ক্ষেত্রে শব্দার্থ বিভাজন / উদাহরণ বিভাগের জন্য চিত্রের ডেটাতে। নির্দিষ্ট ক্লাসের জন্য প্রতি পিক্সেল অ্যাক্টিভেশনগুলি কত বেশি হয় তা দেখার জন্য আমি প্রায়শই "আউট ম্যাপ" হিসাবে নেটওয়ার্ক আউটপুটটির সফটম্যাক্সটি দেখেছি ized আমি স্বল্প ক্রিয়াকলাপগুলিকে "অনিশ্চিত" / …

5
কাঁচা বা অরথোগোনাল বহুবর্ষীয় রিগ্রেশন?
আমি একটি পরিবর্তনশীল প্রত্যাবর্তন করতে চান সম্মুখের । কাঁচা বা অরথোগোনাল বহুপদী ব্যবহার করে আমার এটি করা উচিত? আমি এগুলি নিয়ে সাইটে যে প্রশ্নটি করেছি সেগুলিতে দেখেছি, তবে এগুলি ব্যবহারের মধ্যে পার্থক্য কী তা আমি সত্যিই বুঝতে পারি না। yYyx,x2,…,x5x,x2,…,x5x,x^2,\ldots,x^5 কেন আমি শুধু কোফিসিয়েন্টস পেতে একটি "স্বাভাবিক" রিগ্রেশন ব্যবহার করতে …

1
এক-হট এনকোডিং ব্যবহার করার সময় একটি কলামকে বাদ দেওয়া হচ্ছে
আমার বোধগম্যতা হল মেশিন লার্নিংয়ে এটি সমস্যা হতে পারে যদি আপনার ডেটাসেটের উচ্চতর সম্পর্কযুক্ত বৈশিষ্ট্য থাকে, কারণ তারা কার্যকরভাবে একই তথ্যকে এনকোড করে। সম্প্রতি কেউ চিহ্নিত করেছেন যে আপনি যখন একটি শ্রেণিবদ্ধ ভেরিয়েবলের উপর এক-হট এনকোডিং করেন তখন আপনি সংযুক্ত বৈশিষ্ট্যগুলি সমাপ্ত করেন, সুতরাং আপনার একটি "রেফারেন্স" হিসাবে ছেড়ে দেওয়া …

2
সময় সিরিজের ডেটা জন্য পিসিএ প্রয়োগ করা যেতে পারে?
আমি বুঝতে পারি যে ক্রস বিভাগীয় ডেটার জন্য মূলত অধ্যক্ষ উপাদান উপাদান বিশ্লেষণ (পিসিএ) প্রয়োগ করা যেতে পারে। সময় ধারাবাহিক পরিবর্তনশীল হিসাবে বছর নির্দিষ্ট করে এবং সাধারণত পিসিএ চালিয়ে পিসিএকে কার্যকরভাবে টাইম সিরিজের ডেটার জন্য ব্যবহার করা যেতে পারে? আমি খুঁজে পেয়েছি যে গতিশীল পিসিএ প্যানেল ডেটার জন্য কাজ করে …
22 time-series  pca 

2
পরিসংখ্যান এবং এমএলে কেন "কার্নেল" নাম?
অপারেটিং সিস্টেম এবং লিনিয়ার বীজগণিতের প্রসঙ্গে এটি অন্যান্য এসই সাইটে জিজ্ঞাসা করা হয়েছিল, তবে একই প্রশ্ন আমাকে পরিসংখ্যান এবং মেশিন লার্নিংয়ে ব্যবহৃত কার্নেল পদ্ধতি সম্পর্কে জিজ্ঞাসাবাদ করে। প্রায়শই বলা হয়ে থাকে যে কার্নেলগুলি, যেমন কার্নেল ঘনত্বের অনুমান বা এসভিএমগুলিতে কিছুটা মিলের প্রতিনিধিত্ব করে, তবে 'কার্নেল' নামটি কোথা থেকে এসেছে এবং …


3
সম্ভাবনার সংজ্ঞা নিয়ে ফ্রিকোয়েনসিস্ট এবং বায়েসিয়ার মধ্যে কোনও পার্থক্য আছে কি?
কিছু সূত্র বলেছে যে সম্ভাবনা ফাংশন শর্তসাপেক্ষ সম্ভাবনা নয়, কেউ কেউ বলেন এটি এটি। এটি আমার কাছে খুব বিভ্রান্তিকর। আমি দেখেছি বেশিরভাগ উত্স অনুসারে, প্যারামিটার সহ বিতরণের সম্ভাবনাটি নমুনাগুলি দেওয়া সম্ভাব্য ভর কার্যকারিতার একটি পণ্য হওয়া উচিত :n x iθθ\thetannnxixix_i L(θ)=L(x1,x2,...,xn;θ)=∏i=1np(xi;θ)L(θ)=L(x1,x2,...,xn;θ)=∏i=1np(xi;θ)L(\theta) = L(x_1,x_2,...,x_n;\theta) = \prod_{i=1}^n p(x_i;\theta) লজিস্টিক রিগ্রেশন-এর উদাহরণস্বরূপ, আমরা …

3
এলোমেলো সংখ্যা জেনারেটরে একটি বীজ ঠিক কী?
আমি কিছু সাধারণ গুগল অনুসন্ধান ইত্যাদি চেষ্টা করেছিলাম তবে বেশিরভাগ উত্তর আমার কাছে হয় কিছুটা অস্পষ্ট বা ভাষা / গ্রন্থাগার নির্দিষ্ট যেমন পাইথন বা সি ++ stdlib.hইত্যাদির জন্য আমি কোনও ভাষার অজ্ঞাবলিক, গাণিতিক উত্তর খুঁজছি, কোনও গ্রন্থাগারের নির্দিষ্টকরণ নয়। উদাহরণ হিসাবে, অনেকে বলে যে বীজটি এলোমেলো সংখ্যা জেনারেটরের একটি প্রাথমিক …

4
কেন আমার সিমুলেশনে কেন্দ্রীয় সীমাবদ্ধ তত্ত্বটি ভেঙে যায়?
ধরা যাক আমার নিম্নলিখিত নম্বর আছে: 4,3,5,6,5,3,4,2,5,4,3,6,5 আমি তাদের কয়েকটি নমুনা করেছি, তাদের মধ্যে 5 টি বলুন এবং 5 টি নমুনার যোগফল গণনা করি। তারপরে আমি বহুবার যোগফল পেতে তার পুনরাবৃত্তি করলাম এবং আমি একটি হিস্টোগ্রামে অঙ্কের মূল্য নির্ধারণ করেছি, যা কেন্দ্রীয় সীমাবদ্ধ তত্ত্বের কারণে গাউসিয়ান হবে। কিন্তু যখন তারা …

2
"ইউনিট-ভেরিয়েন্স" রিজ রিগ্রেশন অনুমানের সীমা যখন
অতিরিক্ত বাধা নিয়ে রিজ রিগ্রেশন বিবেচনা করুন যা ; এর বর্গাকার ইউনিটের সমষ্টি (সমানভাবে, ইউনিটের বৈকল্পিক) প্রয়োজন; প্রয়োজনে, কেউ ধরে নিতে পারেন যে এর সাথে বর্গক্ষেত্রের একক রয়েছে:y^y^\hat{\mathbf y}yy\mathbf y β^∗λ=argmin{∥y−Xβ∥2+λ∥β∥2}s.t.∥Xβ∥2=1.β^λ∗=arg⁡min{‖y−Xβ‖2+λ‖β‖2}s.t.‖Xβ‖2=1.\hat{\boldsymbol\beta}_\lambda^* = \arg\min\Big\{\|\mathbf y - \mathbf X \boldsymbol \beta\|^2+\lambda\|\boldsymbol\beta\|^2\Big\} \:\:\text{s.t.}\:\: \|\mathbf X \boldsymbol\beta\|^2=1. β^∗λβ^λ∗\hat{\boldsymbol\beta}_\lambda^* যখন \ ল্যাম্বদা \ থেকে \ …

4
বর্ণনামূলক পরিসংখ্যান জানানোর কী লাভ?
আমি কেবলমাত্র লজিস্টিক রিগ্রেশন ব্যবহার করে আমার ডেটা বিশ্লেষণ করেছি তবে আমার প্রতিবেদনে বর্ণনামূলক পরিসংখ্যানের অংশও থাকা দরকার। আমি সত্যই এর মধ্যে বিন্দুটি দেখতে পাচ্ছি না এবং আমি আশা করছিলাম যে কেউ কেন এটি প্রয়োজনীয় তা ব্যাখ্যা করতে সক্ষম হতে পারেন। উদাহরণস্বরূপ, যদি আমি আমার একটি স্বতন্ত্র ধারাবাহিক পরিবর্তনশীলগুলির একটি …

4
যথেষ্ট পরিমাণে নমুনার আকার দেওয়া হয়েছে, সত্যের প্রভাবের আকারটি ঠিক শূন্য না হওয়া পর্যন্ত একটি পরীক্ষা সর্বদা উল্লেখযোগ্য ফলাফল প্রদর্শন করে। কেন?
প্রভাবের আকারে উইকিপিডিয়ায় নিবন্ধে করা দাবি সম্পর্কে আমি কৌতূহলী । বিশেষ করে: [...] একটি নন-নাল স্ট্যাটিস্টিকাল তুলনা সর্বদা একটি পরিসংখ্যানপূর্ণ তাৎপর্যপূর্ণ ফলাফল দেখায় যদি না জনসংখ্যার প্রভাবের আকার হুবুহু হয় আমি এর অর্থ / ইঙ্গিত কী তা নিশ্চিত নই, এটির ব্যাক আপ নেওয়ার জন্য একটি যুক্তি দেওয়া যাক। আমার ধারণা, …

আমাদের সাইট ব্যবহার করে, আপনি স্বীকার করেছেন যে আপনি আমাদের কুকি নীতি এবং গোপনীয়তা নীতিটি পড়েছেন এবং বুঝতে পেরেছেন ।
Licensed under cc by-sa 3.0 with attribution required.