লজিস্টিক রিগ্রেশন অপ্টিমাইজেশনের জন্য নিউটনের পদ্ধতিটি কেন পুনরুক্তিযুক্ত ন্যূনতম স্কোয়ার্স বলা হয়?

এটি আমার কাছে স্পষ্ট বলে মনে হচ্ছে না কারণ লজিস্টিক ক্ষতি এবং সর্বনিম্ন স্কোয়ার ক্ষতি সম্পূর্ণ ভিন্ন জিনিস।

— হাইতাও ডু
সূত্র

আমি তাদের এক হিসাবে মনে করি না। আইআরএলএস হ'ল পর্যবেক্ষিত হেসিয়ানের চেয়ে প্রত্যাশিত হেসিয়ান সহ নিউটন-রাফসন।

— দিমিত্রি ভি। মাস্টারভ

@ দিমিত্রিভি.মাস্টারভ ধন্যবাদ, আপনি কি আমাকে প্রত্যাশিত হেসিয়ান বনাম আরও কিছু বলতে পারেন? এছাড়াও, আপনি এই ব্যাখ্যা

— হাইটাও ডু

এছাড়াও দেখুন stats.stackexchange.com/questions/236676/…

— কেজেটিল বি হালওয়ারসেন

সংক্ষিপ্তসার: জিএলএমগুলি ফিশার স্কোরিংয়ের মাধ্যমে ফিট রয়েছে যা দিমিত্রি ভি। মাস্টারভের মন্তব্য অনুসারে, নিউটন-রাফসন হ'ল পরিবর্তে প্রত্যাশিত হেসিয়ান (যেমন আমরা পর্যবেক্ষণ করা তথ্যের পরিবর্তে ফিশার তথ্যের একটি অনুমান ব্যবহার করি)। যদি আমরা ক্যানোনিকাল লিঙ্ক ফাংশনটি ব্যবহার করি তবে দেখা যাচ্ছে যে পর্যবেক্ষণ করা হেসিয়ান প্রত্যাশিত হেসিয়ান সমান তাই এনআর এবং ফিশার স্কোরিং একই ক্ষেত্রে একই। যে কোনও উপায়ে, আমরা দেখতে পাব যে ফিশার স্কোরিংটি আসলে একটি ওজনযুক্ত সর্বনিম্ন স্কোয়ার লিনিয়ার মডেলকে ফিট করে এবং লজিস্টিক রিগ্রেশন সম্ভাবনার সর্বাধিক ক্ষেত্রে এই রূপান্তরটি থেকে সহগের অনুমান। ইতিমধ্যে সমস্যার সমাধানে লজিস্টিক রিগ্রেশন ফিটিং হ্রাস করার পাশাপাশি আমরা আমাদের লজিস্টিক রিগ্রেশন সম্পর্কে জানতে চূড়ান্ত ডাব্লুএলএস ফিটের ক্ষেত্রে লিনিয়ার রিগ্রেশন ডায়াগনস্টিকগুলি ব্যবহার করতে সক্ষম হওয়ার সুবিধাও পাই।

আমি এটি লজিস্টিক রিগ্রেশনকে কেন্দ্র করে রাখছি, তবে জিএলএমগুলিতে সর্বাধিক সম্ভাবনার বিষয়ে আরও সাধারণ দৃষ্টিভঙ্গির জন্য আমি এই অধ্যায়ের 15.3 অনুচ্ছেদটি সুপারিশ করছি যা এটির মধ্য দিয়ে যায় এবং আরও সাধারণ সেটিংয়ে আইআরএলএস প্রাপ্ত করে (আমি মনে করি এটি জন ফক্সের প্রয়োগকৃত থেকে এসেছে) রিগ্রেশন অ্যানালাইসিস এবং জেনারাইজড লিনিয়ার মডেলগুলি )।

$^*$ শেষ এ দেখতে মন্তব্য

সম্ভাবনা এবং স্কোর ফাংশন

আমরা ফর্ম কিছু iterating আমাদের GLM ঝুলানো হবে

b^{(m + 1)} = b^{(m)} - J_{(m)}^{- 1} \nabla ℓ (b^{(m)})

$b^{(m+1)} = b^{(m)} - J^{-1}_{(m)}\nabla \ell(b^{(m)})$ যেখানে

ℓ

$\ell$ লগ সম্ভাবনা এবং

J_{m}

$J_{m}$ পারেন হবে লগ সম্ভাবনা পর্যবেক্ষণ বা প্রত্যাশিত Hessian।

আমাদের লিঙ্ক ফাংশন একটি ফাংশন $g$ যে শর্তাধীন গড় মানচিত্র $\mu_i = E(y_i | x_i)$ আমাদের রৈখিক predictor, তাই গড় আমাদের মডেল $g(\mu_i) = x_i^T\beta$ । যাক $h$ বিপরীত লিংক গড় থেকে রৈখিক predictor ম্যাপিং ফাংশন হবে।

একটি লজিস্টিক রিগ্রেশনের জন্য আমাদের কাছে স্বতন্ত্র পর্যবেক্ষণের সাথে বার্নোল্লি সম্ভাবনা রয়েছে তাই ডেরিভেটিভস গ্রহণ,

ℓ (b; y) = \sum_{i = 1}^{n} y_{i} \log h (x_{i}^{T} b) + + (1 - Y_{আমি}) লগ (1 - জ ({এক্স}_{আমি}^{টি} খ)) ।

$\ell(b; y) = \sum_{i=1}^n y_i\log h(x_i^T b) + (1 - y_i) \log(1 - h(x_i^Tb)).$

\frac{\partial ℓ}{\partial খ_{ঞ}} = Σ_{আমি = 1}^{এন} \frac{Y_{আমি}}{জ ({এক্স}_{আমি}^{টি} খ)} জ^{'} ({এক্স}_{আমি}^{টি} খ) {এক্স}_{আমি ঞ} - \frac{1 - Y_{আমি}}{1 - জ ({এক্স}_{আমি}^{টি} খ)} জ^{'} ({এক্স}_{আমি}^{টি} খ) {এক্স}_{আমি ঞ}

$\frac{\partial \ell}{\partial b_j} = \sum_{i=1}^n \frac{y_i}{h(x_i^T b)} h'(x_i^T b) x_{ij} - \frac{1 - y_i}{1 - h(x_i^T b)} h'(x_i^T b) x_{ij}$

= Σ_{আমি = 1}^{এন} {এক্স}_{আমি ঞ} জ^{'} ({এক্স}_{আমি}^{টি} খ) (\frac{Y_{আমি}}{জ ({এক্স}_{আমি}^{টি} খ)} - \frac{1 - Y_{আমি}}{1 - জ ({এক্স}_{আমি}^{টি} খ)})

$= \sum_{i=1}^n x_{ij} h'(x_i^T b) \left(\frac{y_i}{h(x_i^T b)} - \frac{1 - y_i}{1 - h(x_i^T b)} \right)$

= \underset{আমি}{Σ} {এক্স}_{আমি ঞ} \frac{জ^{'} ({এক্স}_{আমি}^{টি} খ)}{জ ({এক্স}_{আমি}^{টি} খ) (1 - জ ({এক্স}_{আমি}^{টি} খ))} (Y_{আমি} - জ ({এক্স}_{আমি}^{টি} খ)) ।

$= \sum_i x_{ij} \frac{h'(x_i^T b)}{h(x_i^T b)(1 - h(x_i^T b))}(y_i - h(x_i^T b)).$

ক্যানোনিকাল লিঙ্কটি ব্যবহার করে

এখন ধরা যাক আমরা ক্যানোনিকাল লিঙ্ক ফাংশন ব্যবহার করছি । তারপরে $g_c = \text{logit}$ তাইযা এই সরলীকৃত মানে $g^{-1}_c(x) := h_c(x) = \frac{1}{1+e^{-x}}$ $h_c' = h_c \cdot (1-h_c)$ তাই উপরন্তু, এখনও ব্যবহার,

\frac{\partial ℓ}{\partial খ_{ঞ}} = \underset{আমি}{Σ} {এক্স}_{আমি ঞ} (Y_{আমি} - জ_{গ} ({এক্স}_{আমি}^{টি} খ))

$\frac{\partial \ell}{\partial b_j} = \sum_i x_{ij} (y_i - h_c(x_i^T b))$

\nabla ℓ (খ; Y) = {এক্স}^{টি} (Y - \hat{Y}) ।

$\nabla \ell (b; y) = X^T (y - \hat y).$

h_{c}

$h_c$

\frac{\partial^{2} ℓ}{\partial খ_{ট} \partial খ_{ঞ}} = - \underset{আমি}{Σ} {এক্স}_{আমি ঞ} \frac{\partial}{\partial খ_{ট}} জ_{গ} ({এক্স}_{আমি}^{টি} খ) = - \underset{আমি}{Σ} {এক্স}_{আমি ঞ} {এক্স}_{আমি ট} [জ_{গ} ({এক্স}_{আমি}^{টি} খ) (1 - জ_{গ} ({এক্স}_{আমি}^{টি} খ))] ।

$\frac{\partial^2 \ell}{\partial b_k \partial b_j} = - \sum_i x_{ij} \frac{\partial}{\partial b_k} h_c(x_i^T b) = - \sum_i x_{ij}x_{ik} \left[h_c(x_i^T b) (1 - h_c(x_i^T b))\right].$

আসুন তারপর আমরা আছে এবং নোট কিভাবে এই কোন নেই , এটা আর তাই(আমরা এর কার্যকারিতা হিসেবে এই দেখছেনতাই শুধুমাত্র র্যান্ডম জিনিসনিজেই)। সুতরাং আমরা দেখিয়েছি যে ফিজার স্কোরিং নিউটন-রাফসনের সমতুল্য যখন আমরা লজিস্টিক রিগ্রেশনে ক্যানোনিকাল লিঙ্কটি ব্যবহার করি। এছাড়াও শক্তি

W = diag (h_{c} (x_{1}^{T} b) (1 - h_{c} (x_{1}^{T} b)), \dots, h_{c} (x_{n}^{T} b) (1 - h_{c} (x_{n}^{T} b))) = diag ({\hat{y}}_{1} (1 - {\hat{y}}_{1}), \dots, {\hat{y}}_{n} (1 - {\hat{y}}_{n})) .

$W = \text{diag}\left(h_c(x_1^T b)(1 - h_c(x_1^T b)), \dots, h_c(x_n^T b)(1 - h_c(x_n^T b))\right) = \text{diag}\left(\hat y_1(1 - \hat y_1), \dots, \hat y_n (1 - \hat y_n)\right).$

H = - X^{T} W X

$H = -X^TWX$

y_{i}

$y_i$

E (H) = H

$E(H) = H$

b

$b$

y

$y$

সবসময়, কঠোরভাবে নেতিবাচক নির্দিষ্ট হতে হবে, যদিও সংখ্যাসূচকভাবে যদি

খুব যাও বন্ধ পায়

বা

তারপর আমরা ওজন করার সুসম্পন্ন হতে পারে

যা করতে পারেন

এবং সেইজন্য গণনা নেতিবাচক semidefinite একক.

{\hat{y}}_{i} \in (0, 1)

$\hat y_i \in (0,1)$

- X^{T} W X

$-X^TWX$

{\hat{y}}_{i}

$\hat y_i$

0

$0$

1

$1$

0

$0$

H

$H$

এখনই তৈরি কাজ প্রতিক্রিয়া এবং মনে রাখবেন $z = W^{-1}(y - \hat y)$

\nabla ℓ = X^{T} (y - \hat{y}) = X^{T} W z .

$\nabla \ell = X^T(y - \hat y) = X^T W z.$

b^{(m + 1)} = b^{(m)} + (X^{T} W_{(m)} X)^{- 1} X^{T} W_{(m)} z_{(m)}

$b^{(m+1)} = b^{(m)} + (X^T W_{(m)} X)^{-1}X^T W_{(m)} z_{(m)}$

(X^{T} W_{(m)} X)^{- 1} X^{T} W_{(m)} z_{(m)}

$(X^T W_{(m)} X)^{-1}X^T W_{(m)} z_{(m)}$

\hat{β}

$\hat \beta$

z_{(m)}

$z_{(m)}$ on

X

$X$ .

Checking this in R:

set.seed(123)
p <- 5
n <- 500
x <- matrix(rnorm(n * p), n, p)
betas <- runif(p, -2, 2)
hc <- function(x) 1 /(1 + exp(-x)) # inverse canonical link
p.true <- hc(x %*% betas)
y <- rbinom(n, 1, p.true)

# fitting with our procedure
my_IRLS_canonical <- function(x, y, b.init, hc, tol=1e-8) {
  change <- Inf
  b.old <- b.init
  while(change > tol) {
    eta <- x %*% b.old  # linear predictor
    y.hat <- hc(eta)
    h.prime_eta <- y.hat * (1 - y.hat)
    z <- (y - y.hat) / h.prime_eta

    b.new <- b.old + lm(z ~ x - 1, weights = h.prime_eta)$coef  # WLS regression
    change <- sqrt(sum((b.new - b.old)^2))
    b.old <- b.new
  }
  b.new
}

my_IRLS_canonical(x, y, rep(1,p), hc)
# x1         x2         x3         x4         x5 
# -1.1149687  2.1897992  1.0271298  0.8702975 -1.2074851

glm(y ~ x - 1, family=binomial())$coef
# x1         x2         x3         x4         x5 
# -1.1149687  2.1897992  1.0271298  0.8702975 -1.2074851

and they agree.

Non-canonical link functions

Now if we're not using the canonical link we don't get the simplification of $\frac{h'}{h(1-h)} = 1$ in $\nabla \ell$ so $H$ becomes much more complicated, and we therefore see a noticeable difference by using $E(H)$ in our Fisher scoring.

Here's how this will go: we already worked out the general $\nabla \ell$ so the Hessian will be the main difficulty. We need

\frac{\partial^{2} ℓ}{\partial b_{k} \partial b_{j}} = \sum_{i} x_{i j} \frac{\partial}{\partial b_{k}} h^{'} (x_{i}^{T} b) (\frac{y_{i}}{h (x_{i}^{T} b)} - \frac{1 - y_{i}}{1 - h (x_{i}^{T} b)})

$\frac{\partial^2 \ell}{\partial b_k \partial b_j} = \sum_i x_{ij} \frac{\partial}{\partial b_k}h'(x_i^T b) \left(\frac{y_i}{h(x_i^T b)} - \frac{1 - y_i}{1 - h(x_i^T b)} \right)$

= \sum_{i} x_{i j} x_{i k} [h^{″} (x_{i}^{T} b) (\frac{y_{i}}{h (x_{i}^{T} b)} - \frac{1 - y_{i}}{1 - h (x_{i}^{T} b)}) - h^{'} (x_{i}^{T} b)^{2} (\frac{y_{i}}{h (x_{i}^{T} b)^{2}} + \frac{1 - y_{i}}{(1 - h (x_{i}^{T} b))^{2}})]

$= \sum_i x_{ij}x_{ik} \left[h''(x_i^T b) \left(\frac{y_i}{h(x_i^T b)} - \frac{1 - y_i}{1 - h(x_i^T b)} \right) - h'(x_i^T b)^2\left(\frac{y_i}{h(x_i^T b)^2} + \frac{1-y_i}{(1-h(x_i^T b))^2} \right)\right]$

Via the linearity of expectation all we need to do to get $E(H)$ is replace each occurrence of $y_i$ with its mean under our model which is $\mu_i=h(x_i^T\beta)$ . Each term in the summand will therefore contain a factor of the form

h^{″} (x_{i}^{T} b) (\frac{h (x_{i}^{T} β)}{h (x_{i}^{T} b)} - \frac{1 - h (x_{i}^{T} β)}{1 - h (x_{i}^{T} b)}) - h^{'} (x_{i}^{T} b)^{2} (\frac{h (x_{i}^{T} β)}{h (x_{i}^{T} b)^{2}} + \frac{1 - h (x_{i}^{T} β)}{(1 - h (x_{i}^{T} b))^{2}}) .

$h''(x_i^T b) \left(\frac{h(x_i^T \beta)}{h(x_i^T b)} - \frac{1 - h(x_i^T \beta)}{1 - h(x_i^T b)} \right) - h'(x_i^T b)^2\left(\frac{h(x_i^T \beta)}{h(x_i^T b)^2} + \frac{1-h(x_i^T \beta)}{(1-h(x_i^T b))^2} \right).$ But to actually do our optimization we'll need to estimate each

β

$\beta$ , and at step

m

$m$

b^{(m)}

$b^{(m)}$ is the best guess we have. This means that this will reduce to

h^{″} (x_{i}^{T} b) (\frac{h (x_{i}^{T} b)}{h (x_{i}^{T} b)} - \frac{1 - h (x_{i}^{T} b)}{1 - h (x_{i}^{T} b)}) - h^{'} (x_{i}^{T} b)^{2} (\frac{h (x_{i}^{T} b)}{h (x_{i}^{T} b)^{2}} + \frac{1 - h (x_{i}^{T} b)}{(1 - h (x_{i}^{T} b))^{2}})

$h''(x_i^T b) \left(\frac{h(x_i^T b)}{h(x_i^T b)} - \frac{1 - h(x_i^T b)}{1 - h(x_i^T b)} \right) - h'(x_i^T b)^2\left(\frac{h(x_i^T b)}{h(x_i^T b)^2} + \frac{1-h(x_i^T b)}{(1-h(x_i^T b))^2} \right)$

= - h^{'} (x_{i}^{T} b)^{2} (\frac{1}{h (x_{i}^{T} b)} + \frac{1}{1 - h (x_{i}^{T} b)})

$= - h'(x_i^T b)^2\left(\frac{1}{h(x_i^T b)} + \frac{1}{1-h(x_i^T b)} \right)$

= - \frac{h^{'} (x_{i}^{T} b)^{2}}{h (x_{i}^{T} b) (1 - h (x_{i}^{T} b))} .

$= -\frac{h'(x_i^T b)^2}{h(x_i^T b)(1-h(x_i^T b))}.$ This means we will use

J

$J$ with

J_{j k} = - \sum_{i} x_{i j} x_{i k} \frac{h^{'} (x_{i}^{T} b)^{2}}{h (x_{i}^{T} b) (1 - h (x_{i}^{T} b))} .

$J_{jk} = -\sum_i x_{ij}x_{ik} \frac{h'(x_i^T b)^2}{h(x_i^T b)(1-h(x_i^T b))}.$

Now let

W^{*} = diag (\frac{h^{'} (x_{1}^{T} b)^{2}}{h (x_{1}^{T} b) (1 - h (x_{1}^{T} b))}, \dots, \frac{h^{'} (x_{n}^{T} b)^{2}}{h (x_{n}^{T} b) (1 - h (x_{n}^{T} b))})

$W^* = \text{diag}\left(\frac{h'(x_1^T b)^2}{h(x_1^T b)(1-h(x_1^T b))} ,\dots, \frac{h'(x_n^T b)^2}{h(x_n^T b)(1-h(x_n^T b))}\right)$ and note how under the canonical link

h_{c}^{'} = h_{c} \cdot (1 - h_{c})

$h_c' = h_c \cdot (1-h_c)$ reduces

W^{*}

$W^*$ to

W

$W$ from the previous section. This lets us write

J = - X^{T} W^{*} X

$J = -X^TW^*X$ except this is now

\hat{E} (H)

$\hat E(H)$ rather than necessarily being

H

$H$ itself, so this can differ from Newton-Raphson. For all

i

$i$

W_{i i}^{*} > 0

$W_{ii}^* > 0$ so aside from numerical issues

J

$J$ will be negative definite.

We have

\frac{\partial ℓ}{\partial b_{j}} = \sum_{i} x_{i j} \frac{h^{'} (x_{i}^{T} b)}{h (x_{i}^{T} b) (1 - h (x_{i}^{T} b))} (y_{i} - h (x_{i}^{T} b))

$\frac{\partial \ell}{\partial b_j} = \sum_i x_{ij} \frac{h'(x_i^T b)}{h(x_i^T b)(1 - h(x_i^T b))}(y_i - h(x_i^T b))$ so letting our new working response be

z^{*} = D^{- 1} (y - \hat{y})

$z^* = D^{-1}(y-\hat y)$ with

D = diag (h^{'} (x_{1}^{T} b), \dots, h^{'} (x_{n}^{T} b))

$D=\text{diag}\left(h'(x_1^T b), \dots, h'(x_n^T b)\right)$ , we have

\nabla ℓ = X^{T} W^{*} z^{*}

$\nabla \ell = X^TW^*z^*$ .

All together we are iterating

b^{(m + 1)} = b^{(m)} + (X^{T} W_{(m)}^{*} X)^{- 1} X^{T} W_{(m)}^{*} z_{(m)}^{*}

$b^{(m+1)} = b^{(m)} + (X^T W_{(m)}^* X)^{-1}X^T W_{(m)}^* z_{(m)}^*$ so this is still a sequence of WLS regressions except now it's not necessarily Newton-Raphson.

I've written it out this way to emphasize the connection to Newton-Raphson, but frequently people will factor the updates so that each new point $b^{(m+1)}$ is itself the WLS solution, rather than a WLS solution added to the current point $b^{(m)}$ . If we wanted to do this, we can do the following:

b^{(m + 1)} = b^{(m)} + (X^{T} W_{(m)}^{*} X)^{- 1} X^{T} W_{(m)}^{*} z_{(m)}^{*}

$b^{(m+1)} = b^{(m)} + (X^T W_{(m)}^* X)^{-1}X^T W_{(m)}^* z_{(m)}^*$

= (X^{T} W_{(m)}^{*} X)^{- 1} (X^{T} W_{(m)}^{*} X b^{(m)} + X^{T} W_{(m)}^{*} z_{(m)}^{*})

$= (X^T W_{(m)}^* X)^{-1}\left(X^T W_{(m)}^* Xb^{(m)}+ X^TW^*_{(m)}z_{(m)}^* \right)$

= (X^{T} W_{(m)}^{*} X)^{- 1} X^{T} W_{(m)}^{*} (X b^{(m)} + z_{(m)}^{*})

$= (X^T W_{(m)}^* X)^{-1}X^TW_{(m)}^*\left(Xb^{(m)}+ z_{(m)}^* \right)$ so if we're going this way you'll see the working response take the form

η^{(m)} + D_{(m)}^{- 1} (y - {\hat{y}}^{(m)})

$\eta^{(m)} + D^{-1}_{(m)}(y - \hat y^{(m)})$ , but it's the same thing.

Let's confirm that this works by using it to perform a probit regression on the same simulated data as before (and this is not the canonical link, so we need this more general form of IRLS).

my_IRLS_general <- function(x, y, b.init, h, h.prime, tol=1e-8) {
  change <- Inf
  b.old <- b.init
  while(change > tol) {
    eta <- x %*% b.old  # linear predictor
    y.hat <- h(eta)
    h.prime_eta <- h.prime(eta)
    w_star <- h.prime_eta^2 / (y.hat * (1 - y.hat))
    z_star <- (y - y.hat) / h.prime_eta

    b.new <- b.old + lm(z_star ~ x - 1, weights = w_star)$coef  # WLS

    change <- sqrt(sum((b.new - b.old)^2))
    b.old <- b.new
  }
  b.new
}

# probit inverse link and derivative
h_probit <- function(x) pnorm(x, 0, 1)
h.prime_probit <- function(x) dnorm(x, 0, 1)

my_IRLS_general(x, y, rep(0,p), h_probit, h.prime_probit)
# x1         x2         x3         x4         x5 
# -0.6456508  1.2520266  0.5820856  0.4982678 -0.6768585 

glm(y~x-1, family=binomial(link="probit"))$coef
# x1         x2         x3         x4         x5 
# -0.6456490  1.2520241  0.5820835  0.4982663 -0.6768581

and again the two agree.

Comments on convergence

Finally, a few quick comments on convergence (I'll keep this brief as this is getting really long and I'm no expert at optimization). Even though theoretically each $J_{(m)}$ is negative definite, bad initial conditions can still prevent this algorithm from converging. In the probit example above, changing the initial conditions to b.init=rep(1,p) results in this, and that doesn't even look like a suspicious initial condition. If you step through the IRLS procedure with that initialization and these simulated data, by the second time through the loop there are some $\hat y_i$ that round to exactly $1$ and so the weights become undefined. If we're using the canonical link in the algorithm I gave we won't ever be dividing by $\hat y_i (1 - \hat y_i)$ to get undefined weights, but if we've got a situation where some $\hat y_i$ are approaching $0$ or $1$ , such as in the case of perfect separation, then we'll still get non-convergence as the gradient dies without us reaching anything.

— jld
সূত্র

+1 টি। আপনার উত্তরগুলি প্রায়শই কীভাবে বিশদ থাকে তা আমি পছন্দ করি।

— অ্যামিবা বলছেন মনিকা পুনরায় স্থাপন করুন

আপনি উল্লেখ করেছেন "সর্বাধিক লজিস্টিক রিগ্রেশন সম্ভাবনার উপর এই রূপান্তরটি থেকে গুণমানের অনুমান।" কোনও প্রাথমিক মান থেকে এটি কি প্রয়োজনীয়?

— মার্ক এল। স্টোন

@ মার্কএল.স্টোন আহ আমি ওখানে খুব নৈমিত্তিক হয়ে উঠছিলাম, অপ্টিমাইজেশনের লোকদের আপত্তি জানাতে চাইছি না :) আমি আরও কিছু বিশদ যুক্ত করব (এবং আমি যখন করব তখন তাদের সম্পর্কে আপনার ধারণার প্রশংসা করব)

— jld

any chance you watched the link I posted? Seems that video is talking from machine learning perspective, just optimize logistic loss, without talking about Hessain expectation?

— Haitao Du

@hxd1011 in that pdf i linked to (link again: sagepub.com/sites/default/files/upm-binaries/…) on page 24 of it the author goes into the theory and explains what exactly makes a link function canonical. I found that pdf extremely helpful when I first came across this (although it took me a while to get through).

— jld