পরিসংখ্যান এবং বড় তথ্য

পরিসংখ্যান, মেশিন লার্নিং, ডেটা বিশ্লেষণ, ডেটা মাইনিং এবং ডেটা ভিজ্যুয়ালাইজেশনে আগ্রহী ব্যক্তিদের জন্য প্রশ্নোত্তর

5
লিনিয়ার রিগ্রেশন মডেলটিতে কি একটি পরিবর্তনশীল তাৎপর্যপূর্ণ?
আমি নমুনা এবং পরিবর্তনশীল পর্যবেক্ষণ সহ একটি লিনিয়ার রিগ্রেশন মডেল পেয়েছি এবং আমি জানতে চাই: কোনও নির্দিষ্ট পরিবর্তনশীল মডেলের অন্তর্ভুক্ত থাকার জন্য যথেষ্ট তাৎপর্যপূর্ণ কিনা। অন্য পরিবর্তনশীল (পর্যবেক্ষণ সহ) মডেলটিতে অন্তর্ভুক্ত করা উচিত কিনা। কোন পরিসংখ্যান আমাকে সাহায্য করতে পারে? কীভাবে এগুলি সবচেয়ে দক্ষতার সাথে পেতে পারেন?

2
একাধিক "হিস্টোগ্রাম" (বার-চার্ট) ভিজ্যুয়ালাইজ করা
ডেটা ভিজ্যুয়ালাইজ করার সঠিক উপায়টি নির্বাচন করতে আমার সমস্যা হচ্ছে। ধরা যাক আমাদের বইয়ের দোকান রয়েছে যা বই বিক্রি করে এবং প্রতিটি বইয়ের কমপক্ষে একটি বিভাগ রয়েছে । একটি বইয়ের দোকানে, আমরা যদি বইয়ের সমস্ত বিভাগ গণনা করি, আমরা একটি হিস্টোগ্রাম অর্জন করি যা সেই বইয়ের দোকানের জন্য একটি নির্দিষ্ট …

2
একই এক্স স্কেল দিয়ে আমি দুটি উল্লম্বভাবে উল্লম্বভাবে কীভাবে স্ট্যাক করব, তবে আর এর মধ্যে একটি আলাদা y স্কেল করব?
গ্রিটিংস, বর্তমানে আমি আর তে নিম্নলিখিতগুলি করছি: require(zoo) data <- read.csv(file="summary.csv",sep=",",head=TRUE) cum = zoo(data$dcomp, as.Date(data$date)) data = zoo(data$compressed, as.Date(data$date)) data <- aggregate(data, identity, tail, 1) cum <- aggregate(cum, identity, sum, 1) days = seq(start(data), end(data), "day") data2 = na.locf(merge(data, zoo(,days))) plot(data2,xlab='',ylab='compressed bytes',col=rgb(0.18,0.34,0.55)) lines(cum,type="h",col=rgb(0,0.5,0)) সংক্ষিপ্তসার স্নিপ.সিএসভি: date,revision,file,lines,nclass,nattr,nrel,bytes,compressed,diff,dcomp 2007-07-25,16,model.xml,96,11,22,5,4035,991,0,0 2007-07-27,17,model.xml,115,16,26,6,4740,1056,53,777 2007-08-09,18,model.xml,106,16,26,7,4966,1136,47,761 2007-08-10,19,model.xml,106,16,26,7,4968,1150,4,202 …


4
ইভেন্টের মোট সংখ্যার জন্য কীভাবে একটি আত্মবিশ্বাসের বিরতি খুঁজে পাবেন
আমার ডিটেক্টর রয়েছে যা কিছু সম্ভাবনা পি সহ একটি ইভেন্ট সনাক্ত করবে । যদি ডিটেক্টর বলে যে কোনও ঘটনা ঘটেছে, তবে এটি সর্বদা ক্ষেত্রে থাকে, সুতরাং মিথ্যা-ধনাত্মকতা নেই। আমি এটি কিছুক্ষণ চালানোর পরে, আমি কে ইভেন্টগুলি সনাক্ত করি। আমি গণনা করতে চাই যে ঘটনার মোট সংখ্যা কী ছিল, সনাক্ত বা …

2
হারানো ডেটা সহ বেঁচে থাকার মডেলটি উপযুক্ত কিনা তা আমি কীভাবে নির্ধারণ করব?
কিছুটা পর্যবেক্ষণ করে, আমার প্রায় দশ মিলিয়ন রেকর্ড রয়েছে যা প্রায় দশ বছর ব্যাপী একটি সিস্টেমে মানুষের প্রবেশের সময় এবং প্রস্থান সময় রেকর্ড করে। প্রতিটি রেকর্ডে একটি প্রবেশের সময় থাকে তবে প্রতিটি রেকর্ডের প্রস্থান সময় হয় না। সিস্টেমে গড় সময় ~ 1 বছর। নিখোঁজ প্রস্থান দুটি কারণে ঘটে: ডেটা ক্যাপচারের …

1
অর্ডিনাল শ্রেণিবদ্ধ পরিবর্তনশীল স্কেল করতে আমি কীভাবে অনুকূল স্কেলিং ব্যবহার করতে পারি?
অবিচ্ছিন্ন হিসাবে শ্রেণীবদ্ধ তথ্য চিকিত্সা সম্পর্কে এই প্রশ্নের উত্তরে , অনুকূল স্কেলিং উল্লেখ করা হয়েছিল। এই পদ্ধতিটি কীভাবে কাজ করে এবং কীভাবে এটি প্রয়োগ করা হয়?

7
সাধারণ বিতরণ এবং একঘেয়ে রূপান্তর
শুনেছি প্রকৃতিতে প্রচুর পরিমাণে সাধারণত বিতরণ করা হয়। এটি সাধারণত কেন্দ্রীয় সীমাবদ্ধ উপপাদ্যটি ব্যবহার করে ন্যায়সঙ্গত হয় যা বলে যে আপনি যখন আইআইডি র‌্যান্ডম ভেরিয়েবলের একটি বড় সংখ্যা গড় করেন তখন আপনি একটি সাধারণ বিতরণ পান। সুতরাং, উদাহরণস্বরূপ, বৃহত সংখ্যক জিনের সংযোজনমূলক প্রভাব দ্বারা নির্ধারিত একটি বৈশিষ্ট্য প্রায় সাধারণত বিতরণ …

2
ক্রস বৈধকরণ বাস্তবায়ন এর ফলাফলগুলিকে প্রভাবিত করে?
আপনি জানেন যে, দুটি জনপ্রিয় ধরণের ক্রস-বৈধতা রয়েছে, কে-ফোল্ড এবং এলোমেলো সাবম্যাপলিং ( উইকিপিডিয়ায় বর্ণিত )। তবুও, আমি জানি যে কিছু গবেষক কাগজপত্র তৈরি এবং প্রকাশ করছেন যেখানে কে-ফোল্ড সিভি হিসাবে বর্ণিত কিছু আসলেই একটি এলোমেলো সাবমেল্পিং যা তাই বাস্তবে আপনি কখনই জানেন না যে আপনি যে নিবন্ধটি পড়ছেন তা …

4
মডেল ফিটিং / প্রশিক্ষণ এবং বৈধতার জন্য ব্যবহৃত নমুনা তথ্যের অনুপাত গণনা করা
ডেটা পূর্বাভাস দেওয়ার জন্য আমি পরিকল্পনা করে এমন একটি নমুনা আকার "এন" সরবরাহ করেছি। ডেটা উপ-বিভক্ত করার কয়েকটি উপায় কী কী যাতে আমি এটির কয়েকটি মডেল স্থাপনের জন্য ব্যবহার করি এবং মডেলটিকে বৈধতা দেওয়ার জন্য বাকী ডেটাগুলি? আমি জানি যে এর কোনও কালো এবং সাদা উত্তর নেই, তবে কিছু "থাম্বের …



10
স্বতন্ত্র অ্যাপ্লিকেশনগুলির জন্য প্রস্তাবিত ভিজ্যুয়ালাইজেশন লাইব্রেরি
কোন ভিজ্যুয়ালাইজেশন লাইব্রেরি (প্লট, গ্রাফ, ...) আপনি একটি স্ট্যান্ডেলোন অ্যাপ্লিকেশন (লিনাক্স,। নেট, উইন্ডোজ, যাই হোক না কেন) ব্যবহার করার পরামর্শ দিবেন। যুক্তিসঙ্গত পারফরম্যান্স পাশাপাশি ভাল হবে।

1
নায়েভ বেয়েস বনাম পুনরাবৃত্ত নিউরাল নেটওয়ার্ক (এলএসটিএম) এর মধ্যে পার্থক্য
আমি পাঠ্যের উপর অনুভূতি বিশ্লেষণ করতে চাই, বেশ কয়েকটি নিবন্ধ পড়েছি, তাদের মধ্যে কিছু "নেভাই বেইস" ব্যবহার করছে এবং অন্যটি "পুনরাবৃত্ত নিউরাল নেটওয়ার্ক (এলএসটিএম)" , অন্যদিকে আমি অনুভূতি বিশ্লেষণের জন্য পাইথন লাইব্রেরি দেখেছি যে nltk হয়। এটি "নাইভ বেয়েস" ব্যবহার করে যে কেউ ব্যাখ্যা করতে পারে যে দুটি ব্যবহারের মধ্যে …

3
স্বাভাবিক বন্টন
একটি পরিসংখ্যান সমস্যা আছে আমার দুর্ভাগ্যবশত কোথায় শুরু করবেন তা সম্পর্কে ধারণা নেই (আমি নিজে থেকে পড়াশোনা করছি তাই আমি জিজ্ঞাসা করতে পারি এমন কেউ নেই, যদি আমি কিছু বুঝতে না পারি তবে) প্রশ্ন হচ্ছে এক্স, YX,YX,Y IID এন( একটি ,খ2) ; a = 0 ;খ2= 6 ; ভি এ …

আমাদের সাইট ব্যবহার করে, আপনি স্বীকার করেছেন যে আপনি আমাদের কুকি নীতি এবং গোপনীয়তা নীতিটি পড়েছেন এবং বুঝতে পেরেছেন ।
Licensed under cc by-sa 3.0 with attribution required.