医薬・生命科学の問題(6問)
問題1:病気と検査
この問題を含む「第一章 確率の基礎」の解説へ
ある病気の有病率を 1% とします。
病気である事象を D、検査陽性である事象を + とします。
P(D)=0.01検査の感度を 95% とします。
感度とは、病気の人を陽性と判定する確率です。
P(+∣D)=0.95検査の特異度を 90% とします。
特異度とは、病気でない人を陰性と判定する確率です。
P(−∣Dc)=0.90したがって、病気でない人が陽性になる確率は、
P(+∣Dc)=0.10です。
検査で陽性だった人が本当に病気である確率を求めます。
| 状態 | 確率 | 陽性になる確率 | 全体に占める陽性 |
|---|
| 病気 D | 0.01 | 0.95 | 0.0095 |
| 病気でない D^c | 0.99 | 0.10 | 0.099 |
| 合計 | 1 | | 0.1085 |
解答・解説を開く別解あり
最初の一歩起こり得る経路を分けて全確率の公式で受信・陽性の確率を求め、その後にベイズの定理で原因側の確率へ戻します。
求めたいのは、
P(D∣+)です。
ベイズの定理より、
P(D∣+)=P(+∣D)P(D)+P(+∣Dc)P(Dc)P(+∣D)P(D)です。
数値を代入すると、
P(D∣+)=0.95×0.01+0.10×0.990.95×0.01分子は、
0.95×0.01=0.0095分母は、
0.0095+0.099=0.1085なので、
P(D∣+)=0.10850.0095≈0.0876です。
つまり、検査が陽性でも、本当に病気である確率は約 8.8% です。
有病率が低い病気では、偽陽性の影響が大きくなります。
別解・別の見方ベイズの公式を直接使う代わりに、対象者を1万人とした2×2表を作り、真陽性者数を陽性者総数で割っても同じ答えになります。
問題2:薬と治療効果は独立か
この問題を含む「第一章 確率の基礎」の解説へ
ある臨床試験で、薬を投与された事象を A、治療効果があった事象を E とします。
次の確率が分かっているとします。
P(A)=0.5,P(E)=0.4,P(E∣A)=0.6薬の投与と治療効果は独立かどうかを、分割表を作って判定します。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
まず、薬を投与され、かつ治療効果があった確率を求めます。
P(A∩E)=P(E∣A)P(A)=0.6×0.5=0.3次に、治療効果があった全体の確率は P(E)=0.4 なので、薬を投与されていないが治療効果があった確率は、
P(Ac∩E)=P(E)−P(A∩E)=0.4−0.3=0.1です。
また、P(A)=0.5 なので、
P(A∩Ec)=P(A)−P(A∩E)=0.5−0.3=0.2です。
残りは、
P(Ac∩Ec)=1−0.3−0.1−0.2=0.4です。
したがって、分割表は次のようになります。
| 効果あり E | 効果なし E^c | 合計 |
|---|
| 投与あり A | 0.3 | 0.2 | 0.5 |
| 投与なし A^c | 0.1 | 0.4 | 0.5 |
| 合計 | 0.4 | 0.6 | 1 |
独立なら、
P(A∩E)=P(A)P(E)が成り立ちます。
しかし、
P(A)P(E)=0.5×0.4=0.2である一方、分割表より、
P(A∩E)=0.3です。
一致しないので、薬の投与と治療効果は独立ではありません。
同じことは条件付き確率でも確認できます。
P(E∣A)=0.6,P(E)=0.4なので、
P(E∣A)=P(E)です。
問題3:副作用の上限
この問題を含む「第一章 確率の基礎」の解説へ
ある薬について、眠気が出る事象を A、吐き気が出る事象を B とします。
P(A)=0.12,P(B)=0.08このとき、眠気または吐き気の少なくとも一方が出る確率の上限を求めます。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
劣加法性より、
P(A∪B)≤P(A)+P(B)です。
したがって、
P(A∪B)≤0.12+0.08=0.20です。
眠気または吐き気の少なくとも一方が出る確率は、高くても 20% と評価できます。
この評価では、眠気と吐き気が独立かどうかを仮定していません。
問題4:有効かつ安全である確率
この問題を含む「第一章 確率の基礎」の解説へ
ある治療で、有効である事象を A、重い副作用が出ない事象を B とします。
P(A)=0.75,P(B)=0.92このとき、「有効であり、かつ重い副作用が出ない」確率の下限を求めます。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
Bonferroni の不等式より、
P(A∩B)≥P(A)+P(B)−1です。
したがって、
P(A∩B)≥0.75+0.92−1=0.67です。
つまり、有効であり、かつ重い副作用が出ない確率は、少なくとも 67% と評価できます。
ここでも、薬効と副作用の有無が独立であるとは仮定していません。
問題5:服薬アドヒアランスと血中濃度
この問題を含む「第一章 確率の基礎」の解説へ
患者が指示通り服薬している事象を A、血中濃度が治療域に入る事象を T とします。
次の確率が分かっているとします。
P(A)=0.8,P(T∣A)=0.9,P(T∣Ac)=0.3血中濃度が治療域に入る確率 P(T) を求めます。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
A と Ac で場合分けして、全確率の公式を使います。
P(T)=P(T∣A)P(A)+P(T∣Ac)P(Ac)です。
ここで、
P(Ac)=1−P(A)=0.2なので、
P(T)=0.9×0.8+0.3×0.2です。
したがって、
P(T)=0.72+0.06=0.78となります。
血中濃度が治療域に入る確率は 78% です。
この例では、服薬アドヒアランスによって血中濃度の分布が変わるため、A と T は一般には独立ではありません。
問題6:AI創薬モデルの陽性的中率
この問題を含む「第一章 確率の基礎」の解説へ
候補化合物の中で、実際に標的タンパク質に強く結合する化合物の割合を 5% とします。
実際に強く結合する事象を A、AIモデルが「有望」と判定する事象を + とします。
P(A)=0.05モデルの感度、つまり実際に強く結合する化合物を有望と判定する確率を 80% とします。
P(+∣A)=0.80一方、実際には強く結合しない化合物を誤って有望と判定する確率を 15% とします。
P(+∣Ac)=0.15モデルが有望と判定した化合物が、実際に強く結合する確率 P(A∣+) を求めます。
AIモデルの陽性判定は、真のヒット率を 5% から約 21.9% に濃縮する情報として解釈できます。解答・解説を開く
最初の一歩起こり得る経路を分けて全確率の公式で受信・陽性の確率を求め、その後にベイズの定理で原因側の確率へ戻します。
ベイズの定理を使います。
P(A∣+)=P(+∣A)P(A)+P(+∣Ac)P(Ac)P(+∣A)P(A)です。
まず、
P(Ac)=1−P(A)=0.95です。
分子は、
P(+∣A)P(A)=0.80×0.05=0.040です。
分母は、
0.80×0.05+0.15×0.95=0.040+0.1425=0.1825です。
したがって、
P(A∣+)=0.18250.040≈0.219となります。
有望と判定された化合物でも、実際に強く結合する確率は約 21.9% です。
これは低く見えるかもしれませんが、ランダムに選ぶと 5% なので、モデルにより候補化合物はかなり濃縮されています。
創薬スクリーニングでは、「当たる確率そのもの」だけでなく、「ベースラインからどれだけ濃縮できたか」も重要です。
数理統計問題(10問)
問題1:離散型確率変数の期待値と分散
この問題を含む「第二章 確率分布と期待値」の解説へ
確率変数 X の確率関数が次で与えられているとします。
| x | 0 | 1 | 2 | 3 |
|---|
| P(X=x) | 0.1 | 0.2 | 0.4 | 0.3 |
- E[X] を求めてください。
- Var(X) を求めてください。
解答・解説を開く別解あり
最初の一歩求める量を定義式へ戻します。平均を先に求め、分散では E[X2]−E[X]2、共分散では積の期待値と平均の積を区別します。
期待値は、
E[X]=x∑xP(X=x)です。
したがって、
E[X]=0⋅0.1+1⋅0.2+2⋅0.4+3⋅0.3です。
計算すると、
E[X]=0+0.2+0.8+0.9=1.9です。
分散は、
Var(X)=E[X2]−(E[X])2で求めます。
まず、
E[X2]=x∑x2P(X=x)なので、
E[X2]=02⋅0.1+12⋅0.2+22⋅0.4+32⋅0.3です。
計算すると、
E[X2]=0+0.2+1.6+2.7=4.5です。
したがって、
Var(X)=4.5−(1.9)2です。
(1.9)2=3.61なので、
Var(X)=4.5−3.61=0.89となります。
別解・別の見方分散は定義どおり E[(X−E[X])2] を各値について足しても求められます。E[X2]−E[X]2 は、その計算を短くした公式です。
問題2:密度関数の定数を決める
この問題を含む「第二章 確率分布と期待値」の解説へ
連続型確率変数 X の密度関数が、
f(x)={cx0(0≤x≤2)(otherwise)で与えられているとします。
- 定数 c を求めてください。
- P(1≤X≤2) を求めてください。
- E[X] を求めてください。
解答・解説を開く
最初の一歩最初に値が動く範囲を確認します。密度は全体を積分して1、分布関数は0から1へ増えることを最後に確かめます。
密度関数なので、全体の面積が 1 です。
∫−∞∞f(x)dx=1です。
ここでは 0≤x≤2 の範囲だけで正なので、
∫02cxdx=1です。
積分すると、
c∫02xdx=c[2x2]02=c⋅24=2cです。
したがって、
2c=1より、
c=21です。
次に、
P(1≤X≤2)=∫1221xdxです。
計算すると、
∫1221xdx=21[2x2]12=41(4−1)=43です。
最後に期待値です。
E[X]=∫−∞∞xf(x)dxなので、
E[X]=∫02x⋅21xdx=21∫02x2dxです。
積分すると、
21[3x3]02=21⋅38=34です。
したがって、
E[X]=34となります。
問題3:積率母関数から平均と分散を求める
この問題を含む「第二章 確率分布と期待値」の解説へ
確率変数 X の積率母関数が、
MX(t)=exp(2t+3t2)で与えられているとします。
E[X] と Var(X) を求めてください。
解答・解説を開く別解あり
最初の一歩最初に母関数の種類と定義を確認します。平均は1階微分、分散は2階微分から得た積率を組み合わせて求めます。
積率母関数から直接求める方法もありますが、この形ではキュムラント母関数を使うと早いです。
KX(t)=logMX(t)なので、
KX(t)=log{exp(2t+3t2)}=2t+3t2です。
キュムラント母関数では、
KX′(0)=E[X]KX′′(0)=Var(X)です。
まず1回微分します。
KX′(t)=2+6tしたがって、
KX′(0)=2です。
よって、
E[X]=2です。
次に2回微分します。
KX′′(t)=6なので、
KX′′(0)=6です。
したがって、
Var(X)=6となります。
別解・別の見方分布が既知なら、確率関数から E[X] と E[X2] を直接計算できます。母関数による方法と照合すると、微分の符号ミスを見つけやすくなります。
問題4:変数変換
この問題を含む「第二章 確率分布と期待値」の解説へ
確率変数 X が区間 (0,1) 上の一様分布に従うとします。
つまり、
fX(x)={10(0<x<1)(otherwise)です。
Y=−logX とおきます。
Y の密度関数を求めてください。
解答・解説を開く別解あり
最初の一歩まず変換後の値が動く範囲を決め、元の変数へ戻す式とヤコビアンを確認します。単調でない変換では、同じ値へ移る元の点をすべて数えます。
まず、変換式を逆に解きます。
Y=−logXなので、
logX=−Yです。
両辺の指数を取ると、
X=e−Yです。
したがって、逆変換は、
x=e−yです。
0<X<1 なので、Y=−logX は 0<Y<∞ を動きます。
連続型の変数変換公式より、
fY(y)=fX(e−y)dyde−yです。
ここで、
dyde−y=−e−yなので、
dyde−y=e−yです。
また、y>0 のとき e−y は (0,1) に入るので、
fX(e−y)=1です。
したがって、
fY(y)=e−y(y>0)です。
それ以外では 0 なので、
fY(y)={e−y0(y>0)(otherwise)となります。
これはパラメータ 1 の指数分布の密度です。
別解・別の見方密度変換公式の代わりに、まず FY(y)=P(g(X)ley) を求め、最後に y で微分する方法があります。単調性が分かりにくいときはこちらが安全です。
問題5:裾確率表示から期待値を求める
この問題を含む「第二章 確率分布と期待値」の解説へ
非負整数値確率変数 X について、
P(X≥1)=0.80,P(X≥2)=0.35,P(X≥3)=0.10,P(X≥4)=0とします。E[X] を求めてください。
解答・解説を開く
最初の一歩求める量を定義式へ戻します。平均を先に求め、分散では E[X2]−E[X]2、共分散では積の期待値と平均の積を区別します。
非負整数値確率変数の裾確率表示、
E[X]=k=1∑∞P(X≥k)を使います。k≥4 の項は0なので、
E[X]=0.80+0.35+0.10=1.25です。
問題6:分布関数から密度・平均・分散を復元する
この問題を含む「第二章 確率分布と期待値」の解説へ
確率変数 X の分布関数が、
FX(x)={01−(1+x)−3(x<0),(x≥0)で与えられています。
- これが分布関数の条件を満たすことを確認してください。
- 確率密度関数を求めてください。
- 裾確率表示を用いて E[X] と Var(X) を求めてください。
解答・解説を開く
最初の一歩求める量を定義式へ戻します。平均を先に求め、分散では E[X2]−E[X]2、共分散では積の期待値と平均の積を区別します。
分布関数には、単調非減少、右連続、x→−∞ で0、x→∞ で1という条件が必要です。
x≥0 では、
FX′(x)=3(1+x)−4>0なので単調増加です。また、FX(0)=0 で左側とつながり、
x→∞limFX(x)=1です。したがって分布関数の条件を満たします。
密度は分布関数を微分して、
fX(x)={3(1+x)−40(x>0),(otherwise)となります。
非負確率変数の裾確率表示より、
E[X]=∫0∞P(X>x)dxです。ここで、P(X>x)=1−FX(x)=(1+x)−3 なので、
E[X]=∫0∞(1+x)−3dx=[−21(1+x)−2]0∞=21.同様に、X≥0 なら、
E[X2]=2∫0∞xP(X>x)dxです。したがって、
E[X2]=2∫0∞(1+x)3xdx=2∫1∞(u−2−u−3)du=2(1−21)=1.よって、
Var(X)=E[X2]−{E[X]}2=1−41=43.答案で気をつけること分布関数は微分する前に、単調性・右連続性・両端の極限を確認します。密度には必ず台を書き、分散では E[X2]−E[X]2 の第2項を落とさないようにします。
問題7:切断分布を条件付き分布として扱う
この問題を含む「第二章 確率分布と期待値」の解説へ
X∼Exp(2) とします。X≥3/2 であった個体だけを解析対象にしたとき、条件付き確率変数
Y=X∣X≥23の密度、平均、分散を求めてください。
解答・解説を開く
最初の一歩条件として分かっている情報を分母に置きます。文章のまま計算せず、分子と分母がどの事象かを先に書くと混乱しません。
切断後の密度は、条件付き確率の定義から、
fY(y)=P(X≥3/2)fX(y)(y≥23)です。指数分布では、
fX(y)=2e−2y,P(X≥3/2)=e−3なので、
fY(y)={2e−2(y−3/2)0(y≥3/2),(otherwise)です。これは、
Y=d23+Z,Z∼Exp(2)を意味します。指数分布の無記憶性を使えば、
E[Y]=23+21=2,Var(Y)=Var(Z)=221=41です。
答案で気をつけること切断後の密度は元の密度をそのまま使わず、残った確率 P(X≥a) で正規化します。また、左切断後の平均は残余時間の平均だけでなく、すでに経過した a も加えます。
問題8:二乗誤差は平均、絶対誤差は中央値を選ぶ
この問題を含む「第二章 確率分布と期待値」の解説へ
E[X2]<∞ とします。実数 t に対して、
L2(t)=E[(X−t)2],L1(t)=E[∣X−t∣]とおきます。
- L2(t) を最小にする t は平均 E[X] であることを示してください。
- X が連続分布に従うとき、L1(t) を最小にする t は中央値であることを示してください。
解答・解説を開く
最初の一歩まず変換後の値が動く範囲を決め、元の変数へ戻す式とヤコビアンを確認します。単調でない変換では、同じ値へ移る元の点をすべて数えます。
μ=E[X] とおくと、
X−t=(X−μ)+(μ−t)です。二乗して期待値を取れば、E[X−μ]=0 より、
L2(t)=E[(X−μ)2]+2(μ−t)E[X−μ]+(μ−t)2=Var(X)+(μ−t)2.第1項は t によらず、第2項は t=μ で最小になるので、二乗誤差を最小にする点は平均です。
次に、密度を f、分布関数を F とすると、
L1(t)=∫−∞t(t−x)f(x)dx+∫t∞(x−t)f(x)dxです。積分区間の端点も t に依存するので、Leibnizの公式を用いて微分します。端点では被積分関数が0になるため、
L1′(t)=∫−∞tf(x)dx−∫t∞f(x)dx=F(t)−{1−F(t)}=2F(t)−1.したがって L1′(t)=0 となるのは、
F(t)=21を満たす中央値です。F が狭義単調なら最小点は一意です。
答案で気をつけること「微分して0」だけで終えず、二乗誤差では平方項が非負であること、絶対誤差では導関数が負から正へ変わることを示します。離散分布では中央値が区間になる場合があるため、P(X≤m)≥1/2 かつ P(X≥m)≥1/2 と書くのが安全です。
問題9:非単調な変数変換では逆像を足し合わせる
この問題を含む「第二章 確率分布と期待値」の解説へ
X∼Unif(−3,1) とし、Y=X2 とします。
Y の確率密度関数、平均、分散を求めてください。
解答・解説を開く別解あり
最初の一歩まず変換後の値が動く範囲を決め、元の変数へ戻す式とヤコビアンを確認します。単調でない変換では、同じ値へ移る元の点をすべて数えます。
まず値域は、
0≤Y<9です。y>0 に対する逆像は x=±y ですが、両方が常に X の台 (−3,1) に入るわけではありません。
- 0<y<1 では、y と −y の両方が台に入る
- 1≤y<9 では、−y だけが台に入る
各枝のJacobianは、
dydx=2y1で、fX(x)=1/4 です。したがって、
fY(y)=⎩⎨⎧4y18y10(0<y<1),(1≤y<9),(otherwise)となります。
積率は Y=X2 を直接用いると簡単です。
E[Y]=E[X2]=41∫−31x2dx=37であり、
E[Y2]=E[X4]=41∫−31x4dx=561です。よって、
Var(Y)=561−(37)2=45304.答案で気をつけることx↦x2 は単調でないため、公式を1本の逆関数だけに適用してはいけません。最初に Y の台を求め、各 y で台に入る逆像を列挙し、その密度寄与を足します。
別解・別の見方分布関数法なら、FY(y)=P(X2ley) を区間の確率として書けます。逆像を漏らしにくいため、非単調変換では特に有効です。
発展問題10:裾確率と分位点から期待値を表す
この問題を含む「第二章 確率分布と期待値」の解説へ
E[∣X∣]<∞ とします。次を示してください。
E[X]=∫0∞{1−FX(x)}dx−∫−∞0FX(x)dxまた、連続な分布関数に対して、
E[X]=∫01FX−1(u)duが成り立つ理由を説明してください。最後に、非負確率変数 Z の生存関数が P(Z>x)=(1+x)−2 のとき、E[Z] を求めてください。
解答・解説を開く
最初の一歩求める量を定義式へ戻します。平均を先に求め、分散では E[X2]−E[X]2、共分散では積の期待値と平均の積を区別します。
X+=max(X,0)、X−=max(−X,0) とすると、X=X+−X− です。非負確率変数の裾確率表示より、
E[X+]=∫0∞P(X>x)dx=∫0∞{1−FX(x)}dxです。また、
E[X−]=∫0∞P(X<−x)dx=∫−∞0FX(x)dxなので、差を取れば最初の式を得ます。
一方、U∼Unif(0,1) とすると、逆変換法により、
FX−1(U)=dXです。したがって、
E[X]=E[FX−1(U)]=∫01FX−1(u)du.最後に、
E[Z]=∫0∞(1+x)−2dx=[−(1+x)−1]0∞=1.答案で気をつけること符号を持つ確率変数では正部分と負部分を分けます。分位点表示では、一般には一般化逆関数 F−1(u)=inf{x:F(x)≥u} を使うと、不連続な分布にも拡張できます。
医薬・生命科学の問題(8問)
問題1:副作用発現人数の期待値
この問題を含む「第二章 確率分布と期待値」の解説へ
ある薬剤で、患者1人に軽度の副作用が起こる確率を π=0.08 とします。
20人の患者を独立に観察し、副作用が起きた人数を X とします。
- X の分布を答えてください。
- E[X] と Var(X) を求めてください。
- P(X=0) を求めてください。
解答・解説を開く
最初の一歩求める量を定義式へ戻します。平均を先に求め、分散では E[X2]−E[X]2、共分散では積の期待値と平均の積を区別します。
各患者について、副作用が起きるかどうかをベルヌーイ試行と見ます。
20人を独立に観察するので、
X∼Bin(20,0.08)です。
二項分布の期待値と分散は、
E[X]=nπVar(X)=nπ(1−π)です。
ここではこの公式をそのまま使わず、ベルヌーイ変数の和として確認します。
患者 i に副作用が起きたら Xi=1、起きなければ Xi=0 とします。
すると、
X=X1+⋯+X20です。
各 Xi は、
P(Xi=1)=0.08,P(Xi=0)=0.92を満たします。
したがって、
E[Xi]=1⋅0.08+0⋅0.92=0.08です。
期待値の線形性より、
E[X]=E[X1+⋯+X20]=E[X1]+⋯+E[X20]なので、
E[X]=20⋅0.08=1.6です。
次に分散を計算します。
Xi は 0 または 1 だけを取るので、Xi2=Xi です。
したがって、
E[Xi2]=E[Xi]=0.08です。
分散の公式より、
Var(Xi)=E[Xi2]−(E[Xi])2=0.08−(0.08)2です。
計算すると、
0.08−(0.08)2=0.08−0.0064=0.0736です。
独立な確率変数の和では分散が足せるので、
Var(X)=20⋅0.0736=1.472となります。
したがって、
E[X]=20⋅0.08=1.6Var(X)=20⋅0.08⋅0.92=1.472です。
また、
P(X=0)=(020)0.080(0.92)20=0.9220≈0.189です。
副作用確率が8%でも、20人観察して1人も出ない確率は約18.9%あります。
「観察されなかった」ことは「起こらない」ことを意味しない、という点が重要です。
問題2:服薬忘れ回数と確率母関数
この問題を含む「第二章 確率分布と期待値」の解説へ
ある患者の1週間の服薬忘れ回数 X がポアソン分布
X∼Poisson(λ)に従うとします。
- 確率母関数 GX(s) を求めてください。
- E[X] を確率母関数から求めてください。
解答・解説を開く
最初の一歩最初に母関数の種類と定義を確認します。平均は1階微分、分散は2階微分から得た積率を組み合わせて求めます。
ポアソン分布の確率関数は、
P(X=x)=e−λx!λx(x=0,1,2,…)です。
したがって、
GX(s)=E[sX]=x=0∑∞sxe−λx!λxです。
整理すると、
GX(s)=e−λx=0∑∞x!(λs)x=e−λeλs=eλ(s−1)となります。
途中で使った
x=0∑∞x!(λs)x=eλsは、指数関数のマクローリン展開
eu=x=0∑∞x!uxに u=λs を代入したものです。
数IIIの範囲を少し越えて見える場合は、「指数関数はこの無限級数で表せる」と受け取れば大丈夫です。
統計検定1級では、ポアソン分布の母関数計算で頻繁に出てきます。
期待値は、
GX′(1)=E[X]で求められます。
GX′(s)=λeλ(s−1)なので、
GX′(1)=λです。
よって、
E[X]=λとなります。
問題3:血中濃度の対数変換
この問題を含む「第二章 確率分布と期待値」の解説へ
ある薬の投与後血中濃度 X が正の値をとり、
Y=logXが正規分布 N(μ,σ2) に従うとします。
- X の分布名を答えてください。
- X の密度関数を求めてください。
- なぜ薬物動態で対数変換がよく使われるか説明してください。
解答・解説を開く
最初の一歩まず変換後の値が動く範囲を決め、元の変数へ戻す式とヤコビアンを確認します。単調でない変換では、同じ値へ移る元の点をすべて数えます。
logX が正規分布に従うので、X は 対数正規分布 に従います。
Y=logX の逆変換は、
x=eyです。
密度を求めたい変数は X なので、逆に
y=logxと書いておきます。
Y の密度は正規分布の密度なので、
fY(y)=σ2π1exp{−2σ2(y−μ)2}です。
密度を Y から X に変換するときは、
fX(x)=fY(logx)dxdlogxを使います。
ここで、
dxdlogx=x1です。
したがって、
fY(logx)=σ2π1exp{−2σ2(logx−μ)2}であり、これに x1 を掛けるので、
fX(x)=xσ2π1exp{−2σ2(logx−μ)2}(x>0)となります。
薬物動態で対数変換がよく使われる理由は、濃度やAUCが負にならず、個体差が「足し算」より「倍率」で現れやすいからです。
例えば、ある患者のAUCが別の患者の2倍という違いは、元のスケールでは右に長い分布を作りやすいです。
対数を取ると倍率の違いが加法的な違いになり、正規分布に近づくことがあります。
問題4:キュムラント母関数で二項分布を見る
この問題を含む「第二章 確率分布と期待値」の解説へ
X∼Bin(n,π) とします。
- 積率母関数 MX(t) を求めてください。
- キュムラント母関数 KX(t) を求めてください。
- KX′(0) と KX′′(0) を確認してください。
解答・解説を開く
最初の一歩最初に母関数の種類と定義を確認します。平均は1階微分、分散は2階微分から得た積率を組み合わせて求めます。
二項分布の積率母関数は、
MX(t)={(1−π)+πet}nです。
したがって、キュムラント母関数は、
KX(t)=logMX(t)=nlog{(1−π)+πet}です。
積率母関数を導出すると、まず
MX(t)=E[etX]=x=0∑netxP(X=x)です。
二項分布の確率関数を代入すると、
MX(t)=x=0∑netx(xn)πx(1−π)n−xとなります。
etxπx=(πet)x なので、
MX(t)=x=0∑n(xn)(πet)x(1−π)n−xです。
二項定理より、
MX(t)={(1−π)+πet}nが得られます。
1回微分すると、
KX′(t)=n(1−π)+πetπetなので、
KX′(0)=nπです。
これは二項分布の期待値です。
さらに2回微分すると、
KX′′(0)=nπ(1−π)となります。
この2回微分も省略せずに書くと、まず
KX′(t)=n(1−π)+πetπetです。
ここで
A(t)=πet,B(t)=(1−π)+πetとおくと、
KX′(t)=nB(t)A(t)です。
商の微分より、
KX′′(t)=n{B(t)}2A′(t)B(t)−A(t)B′(t)です。
A′(t)=πet、B′(t)=πet だから、
KX′′(t)=n{(1−π)+πet}2πet{(1−π)+πet}−(πet)(πet)です。
分子を整理すると、
πet(1−π)+π2e2t−π2e2t=π(1−π)etなので、
KX′′(t)=n{(1−π)+πet}2π(1−π)etです。
t=0 を代入すると e0=1 で、分母は
{(1−π)+π}2=1なので、
KX′′(0)=nπ(1−π)となります。
これは二項分布の分散です。
このように、キュムラント母関数は平均と分散を直接取り出せます。
独立な和ではキュムラントが足し算になるため、複数患者の反応数や複数検体の陽性数を合計する場面で考え方が役立ちます。
問題5:コロニー数とポアソン分布
この問題を含む「第二章 確率分布と期待値」の解説へ
ある抗菌薬処理後のプレートで、一定面積あたりの耐性コロニー数 X がポアソン分布
X∼Poisson(λ)に従うとします。
平均して1視野あたり 2.4 個のコロニーが観察されるとき、次を求めます。
- P(X=0)
- P(X≥1)
- E[X] と Var(X)
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
ポアソン分布の確率関数は、
P(X=x)=e−λx!λx(x=0,1,2,…)です。
ここでは λ=2.4 です。
まず、コロニーが0個の確率は、
P(X=0)=e−2.40!2.40です。
ここで、
2.40=1,0!=1なので、
P(X=0)=e−2.4です。
数値としては、
e−2.4≈0.0907です。
次に、少なくとも1個観察される確率は、補集合を使って、
P(X≥1)=1−P(X=0)です。
したがって、
P(X≥1)=1−e−2.4≈1−0.0907=0.9093となります。
ポアソン分布では、
E[X]=λ,Var(X)=λです。
したがって、
E[X]=2.4,Var(X)=2.4です。
この「平均と分散が等しい」という性質は、生命科学データを見るときの重要な診断点です。
実際のコロニー数データで標本分散が標本平均よりかなり大きいなら、細胞状態のばらつきや局所的な増殖差があり、単純なポアソン分布では足りない可能性があります。
問題6:IC50 の対数スケール
この問題を含む「第二章 確率分布と期待値」の解説へ
ある化合物の IC50 を X とします。
IC50 は正の値で、実験を繰り返すと倍率方向にばらつくことが多いため、
Y=log10Xを考えます。
ここで、
Y∼N(−6,0.22)とします。
つまり、log10IC50 の平均が −6、標準偏差が 0.2 です。
- IC50 の中央値を求めてください。
- Y が平均から +1 標準偏差だけ大きいとき、IC50 は中央値の何倍ですか。
- なぜ IC50 は元のスケールより対数スケールで扱いやすいのか説明してください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
まず、
Y=log10Xなので、
X=10Yです。
対数正規型の分布では、対数を取った変数 Y の中央値が、元の変数 X の中央値に対応します。
ここでは Y の平均も中央値も −6 なので、IC50 の中央値は、
10−6です。
単位が mol/L なら、
10−6mol/L=1μMです。
次に、Y が平均から +1 標準偏差だけ大きい値は、
−6+0.2=−5.8です。
このときの IC50 は、
10−5.8です。
中央値 10−6 との比を取ると、
10−610−5.8=100.2です。
数値として、
100.2≈1.58なので、約 1.58 倍です。
IC50 は濃度なので、0以下にはなりません。
また、実験誤差や生物学的ばらつきは「0.1 μM 増える」という足し算より、「1.5倍になる」「2倍になる」という倍率で現れることがあります。
対数を取ると、倍率の違いが足し算の違いになります。
そのため、正規分布近似、信頼区間、回帰モデルに載せやすくなります。
問題7:細胞生存率の期待値
この問題を含む「第二章 確率分布と期待値」の解説へ
ある濃度の薬剤を処理したウェルで、細胞が生存する確率を p=0.72 とします。
1ウェル内で独立に観察できる細胞を 100 個とし、生存細胞数を X とします。
- X の分布を答えてください。
- 生存率 R=X/100 の期待値と分散を求めてください。
解答・解説を開く
最初の一歩求める量を定義式へ戻します。平均を先に求め、分散では E[X2]−E[X]2、共分散では積の期待値と平均の積を区別します。
各細胞について、生存なら 1、非生存なら 0 と考えます。
100個の細胞を独立に観察できると仮定すると、
X∼Bin(100,0.72)です。
二項分布より、
E[X]=np=100⋅0.72=72です。
また、
Var(X)=np(1−p)=100⋅0.72⋅0.28です。
計算すると、
Var(X)=20.16です。
生存率は、
R=100Xです。
期待値は定数倍の性質より、
E[R]=E[100X]=1001E[X]=10072=0.72です。
分散では、定数倍するとその定数の2乗が前に出ます。
つまり、
Var(aX)=a2Var(X)です。
ここで a=1/100 なので、
Var(R)=Var(100X)=10021Var(X)です。
したがって、
Var(R)=1000020.16=0.002016です。
この例はシンプルですが、細胞生存率、陽性細胞率、発現細胞割合のようなデータを考える入口になります。
実際の実験では細胞どうしが完全に独立でないことや、ウェル間差があることも多いため、二項分布からのずれを見ることが重要です。
問題8:濃度指標の分位点を単位換算する
この問題を含む「第二章 確率分布と期待値」の解説へ
ある濃度指標 X の95パーセンタイルが、
q0.95(X)=2.4 mg/Lであるとします。Y=1000X として ng/mL へ単位換算したとき、Y の95パーセンタイルを求めてください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
Y=1000X は正の係数による線形変換です。そのため、観測値の順序は変わらず、同じ確率に対応する分位点も1000倍されます。
q0.95(Y)=1000q0.95(X)=1000×2.4=2400 ng/mLです。単位換算では代表値だけでなく、中央値や95パーセンタイルなどの分位点も同じ係数で変換されます。
数理統計問題(17問)
問題1:二項分布の正規近似
この問題を含む「第三章 さまざまな確率分布」の解説へ
X∼Bin(200,0.30)とします。P(50≤X≤70) を、連続補正を用いて正規近似してください。
解答・解説を開く別解あり
最初の一歩元の統計量、中心化、尺度化、使う定理とその条件の順に整理します。近似では標本数や独立性などの条件も答案に添えます。
二項分布の平均と分散は、
μ=np=200×0.30=60σ2=np(1−p)=200×0.30×0.70=42です。したがって、
σ=42≈6.481です。
50≤X≤70 に連続補正を行うと、
49.5≤Y≤70.5とします。ただし、Y∼N(60,42) です。
下側を標準化すると、
z1=4249.5−60≈−1.62上側は、
z2=4270.5−60≈1.62です。標準正規分布表より Φ(1.62)≈0.9474 なので、対称性を使って、
P(50≤X≤70)≈Φ(1.62)−Φ(−1.62)=0.9474−(1−0.9474)=0.8948となります。
別解・別の見方二項変数を独立なベルヌーイ変数の和と見て、中心極限定理を適用しても同じ正規近似が得られます。連続補正は最後に境界へ 0.5 を足し引きします。
問題2:超幾何分布
この問題を含む「第三章 さまざまな確率分布」の解説へ
30本の試料のうち6本が陽性です。ここから5本を非復元で無作為抽出します。
少なくとも1本の陽性試料が含まれる確率を求めてください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
全体 N=30、陽性 K=6、抽出数 n=5 です。
陽性試料数 X は超幾何分布に従います。
少なくとも1本を直接足すより、陽性が0本である余事象を使います。
P(X≥1)=1−P(X=0)0本が陽性ということは、陰性24本から5本すべてを選ぶことなので、
P(X=0)=(530)(06)(524)=(530)(524)です。
(524)=42504,(530)=142506より、
P(X≥1)=1−14250642504≈0.7017です。
問題3:ポアソン過程とガンマ分布
この問題を含む「第三章 さまざまな確率分布」の解説へ
イベントが1時間当たり λ=0.5 のポアソン過程に従って発生します。
3回目のイベントまでの待ち時間を T とします。
- T の分布、平均、分散を求めてください。
- 4時間以内に3回目のイベントが起こる確率を求めてください。
解答・解説を開く別解あり
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
1回ごとの待ち時間は率 0.5 の指数分布です。
3回目までの待ち時間は独立な指数待ち時間3個の和なので、形状3、率0.5のガンマ分布です。
尺度で書けば、
θ=λ1=2なので、
T∼Gamma(3,2)です。
E[T]=αθ=3×2=6Var(T)=αθ2=3×22=12です。
4時間以内に3回目が起こることは、4時間以内のイベント数 N(4) が3以上であることと同じです。
N(4)∼Poisson(0.5×4)=Poisson(2)したがって、
P(T≤4)=P{N(4)≥3}=1−P{N(4)≤2}=1−e−2(1+2+2!22)=1−5e−2≈0.3233です。待ち時間の問題を発生回数の問題に読み替える関係は頻出です。
別解・別の見方到着時刻の和としてガンマ分布を使う代わりに、「時刻 t までの到着回数が所定回数未満」というポアソン分布の事象へ言い換えても計算できます。
問題4:正規標本から生じる分布
この問題を含む「第三章 さまざまな確率分布」の解説へ
X1,…,X9 を、平均 μ、分散 σ2 の正規母集団からの無作為標本とします。
- (8S2)/σ2 は何分布に従いますか。
- (Xˉ−μ)/(S/3) は何分布に従いますか。
- 実現値が S2=4、母分散が σ2=2 のとき、1の統計量の値を求めてください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
標本サイズは n=9 なので、標本分散に対応する自由度は、
n−1=8です。したがって、
σ2(n−1)S2=σ28S2∼χ82です。
また、
n=9=3なので、
S/3Xˉ−μ=S/nXˉ−μ∼t8です。
実現値を代入すると、
σ28S2=28×4=16です。
同じ標本から標本平均と標本分散を作っていますが、正規標本では Xˉ と S2 が独立になることが、t 分布の導出で重要です。
問題5:t分布とF分布の関係
この問題を含む「第三章 さまざまな確率分布」の解説へ
T∼t12とします。
- T2 の分布を答えてください。
- 両側検定の棄却条件が ∣T∣>2.179 であるとき、T2 を使った同値な棄却条件を書いてください。
解答・解説を開く
最初の一歩値の範囲、数えた値か測った値か、値が生じる仕組みの3点から候補を絞ります。分布名だけでなく、選んだ理由まで言葉にします。
t 分布の定義から、
T=V/12Zただし、Z∼N(0,1)、V∼χ122 で独立です。
平方すると、
T2=V/12Z2/1です。Z2∼χ12 なので、
T2∼F1,12です。
また、
∣T∣>2.179の両辺を平方すると、
T2>(2.179)2です。
(2.179)2≈4.748なので、同値な棄却条件は、
F>4.748,F=T2∼F1,12です。2群の平均差を調べる t 検定と、1自由度の効果を調べる F 検定が対応する理由です。
問題6:密度関数の正規化とガンマ分布
この問題を含む「第三章 さまざまな確率分布」の解説へ
f(x)=cxe−x(x>0)が確率密度関数となるように定数 c を決め、E[X] と Var(X) を求めてください。
解答・解説を開く
最初の一歩最初に値が動く範囲を確認します。密度は全体を積分して1、分布関数は0から1へ増えることを最後に確かめます。
密度関数の全積分は1なので、
∫0∞cxe−xdx=1です。ガンマ関数を使うと、
∫0∞xe−xdx=Γ(2)=1!=1なので、
c=1です。
期待値は、
E[X]=∫0∞x⋅xe−xdx=∫0∞x2e−xdx=Γ(3)=2!=2です。
次に、
E[X2]=∫0∞x2⋅xe−xdx=∫0∞x3e−xdx=Γ(4)=3!=6です。したがって、
Var(X)=E[X2]−{E[X]}2=6−22=2です。
この密度は、
X∼Gamma(2,1)の密度でもあります。公式 E[X]=αθ、Var(X)=αθ2 とも一致します。
問題7:一様分布から指数分布を作る
この問題を含む「第三章 さまざまな確率分布」の解説へ
U∼U(0,1)とし、λ>0 に対して、
X=−λ1logUとおきます。X の分布関数を導き、分布を特定してください。
解答・解説を開く別解あり
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
0<U<1 なので、logU<0 です。したがって X>0 です。
x>0 に対して、
FX(x)=P(X≤x)を求めます。
P(−λ1logU≤x)両辺に正の数 λ を掛けると、
P(−logU≤λx)です。両辺に −1 を掛けると不等号が逆向きになり、
P(logU≥−λx)です。指数関数は単調増加なので、
P(U≥e−λx)となります。U は (0,1) 上の一様分布なので、
P(U≥u)=1−uです。よって、
FX(x)=1−e−λx(x>0)となります。これは率 λ の指数分布の分布関数です。
X∼Exp(λ)です。この方法を逆関数法といい、一様乱数からさまざまな分布の乱数を作る基本になります。
別解・別の見方ヤコビアン公式を使わず、FY(y)=P(−logXley) を求めて微分しても指数分布が得られます。
問題8:分布の関係を言葉で説明する
この問題を含む「第三章 さまざまな確率分布」の解説へ
次の空欄を埋め、その関係を1文で説明してください。
- 独立なベルヌーイ分布を n 個足すと( )分布になる。
- 二項分布で n→∞,p→0,np=λ とすると( )分布に近づく。
- 独立な標準正規分布の平方を ν 個足すと( )分布になる。
- 自由度 ν の t 分布を平方すると( )分布になる。
- ガンマ分布で形状母数を1にすると( )分布になる。
解答・解説を開く
最初の一歩値の範囲、数えた値か測った値か、値が生じる仕組みの3点から候補を絞ります。分布名だけでなく、選んだ理由まで言葉にします。
- 二項分布。各ベルヌーイ変数が1なら成功、0なら失敗なので、和は成功回数になります。
- ポアソン分布。多数回の試行における、一定の平均回数を持つまれな成功の極限です。
- 自由度 ν のカイ二乗分布。自由度は独立な平方項の個数に対応します。
- F1,ν 分布。t 分布の分子にある標準正規変数を平方すると、自由度1のカイ二乗分布になります。
- 指数分布。ガンマ分布は複数回目までの待ち時間を表し、形状1は最初の1回までの待ち時間です。
問題9:確率母関数から分布を復元する
この問題を含む「第三章 さまざまな確率分布」の解説へ
非負整数値確率変数 X の確率母関数が、
GX(s)=exp{3(s−1)}で与えられています。
- X の確率関数を求め、分布を特定してください。
- E[X] と Var(X) を求めてください。
解答・解説を開く
最初の一歩最初に母関数の種類と定義を確認します。平均は1階微分、分散は2階微分から得た積率を組み合わせて求めます。
まず、
GX(s)=e−3e3sと分けます。指数関数の展開から、
e3s=x=0∑∞x!(3s)xなので、
GX(s)=x=0∑∞(e−3x!3x)sxです。sx の係数が P(X=x) なので、
P(X=x)=e−3x!3xです。したがって、
X∼Poisson(3)です。
母関数を微分すると、
GX′(s)=3e3(s−1)より、
E[X]=GX′(1)=3です。また、
GX′′(s)=9e3(s−1)なので、
E[X(X−1)]=GX′′(1)=9です。したがって、
E[X2]=9+3=12Var(X)=12−32=3です。
問題10:積率母関数からガンマ分布の平均と分散を導く
この問題を含む「第三章 さまざまな確率分布」の解説へ
MX(t)=(1−2t)−3とします。X の分布を特定し、平均と分散を求めてください。
解答・解説を開く
最初の一歩最初に母関数の種類と定義を確認します。平均は1階微分、分散は2階微分から得た積率を組み合わせて求めます。
形状 α、尺度 θ のガンマ分布の積率母関数は、
MX(t)=(1−θt)−αです。比較すると、
α=3,θ=2なので、
X∼Gamma(3,2)です。
1回微分すると、
MX′(t)=6(1−2t)−4なので、
E[X]=MX′(0)=6です。2回微分すると、
MX′′(t)=48(1−2t)−5より、
E[X2]=MX′′(0)=48です。したがって、
Var(X)=48−62=12です。公式 αθ=6、αθ2=12 と一致します。
問題11:最大反応値の分布
この問題を含む「第三章 さまざまな確率分布」の解説へ
X1,…,X5 が独立に U(0,1) に従うとします。
最大値 M=max(X1,…,X5) の分布関数、密度関数、期待値を求めてください。
解答・解説を開く別解あり
最初の一歩最大値が x 以下である事象を「すべての観測値が x 以下」と言い換え、まず分布関数を求めます。密度が必要なら最後に微分します。
0<m<1 に対して、最大値が m 以下であることは、5個すべてが m 以下であることです。
FM(m)=P(X1≤m,…,X5≤m)独立性と P(Xi≤m)=m より、
FM(m)=m5です。したがって、
FM(m)=⎩⎨⎧0m51(m≤0)(0<m<1)(m≥1)です。微分すると、
fM(m)=5m4(0<m<1)です。これは Beta(5,1) の密度です。期待値は、
E[M]=5+15=65です。
別解・別の見方一般の順序統計量の公式を知っていれば、最大値の密度 nF(x)n−1f(x) を直接使えます。分布関数から導く方法の短縮形です。
発展 問題12:多変量正規分布の線形結合
この問題を含む「第三章 さまざまな確率分布」の解説へ
(X1X2)∼N2((1020),(4339))とします。Y=X1+2X2 の分布を求めてください。
解答・解説を開く
最初の一歩独立性と共分散の有無を確認してから、和の確率、畳み込み、または線形結合の公式を選びます。
a=(12)とすると、Y=aTX です。
平均は、
E[Y]=1×10+2×20=50です。分散は、
Var(Y)=aTΣaです。成分で計算すると、
Var(Y)=12×4+22×9+2×1×2×3=4+36+12=52です。したがって、
Y∼N(50,52)です。共分散3を無視すると分散を40と誤るため、相関したバイオマーカーの合成では共分散項が重要です。
発展 問題13:非心カイ二乗分布
この問題を含む「第三章 さまざまな確率分布」の解説へ
独立な、
Z1∼N(1,1),Z2∼N(2,1),Z3∼N(0,1)に対し、Q=Z12+Z22+Z32 とします。
Q の自由度、非心度、平均、分散を求めてください。
解答・解説を開く
最初の一歩まず変換後の値が動く範囲を決め、元の変数へ戻す式とヤコビアンを確認します。単調でない変換では、同じ値へ移る元の点をすべて数えます。
独立な正規変数の平方を3個足しているので、自由度は、
ν=3です。非心度は平均の平方和なので、
δ=12+22+02=5です。したがって、Q は自由度3、非心度5の非心カイ二乗分布に従います。
E[Q]=ν+δ=3+5=8Var(Q)=2(ν+2δ)=2(3+10)=26です。
問題14:超幾何分布から二項分布への収束
この問題を含む「第三章 さまざまな確率分布」の解説へ
大きさ N の有限母集団に成功個体が MN 個あり、非復元で一定個数 k を抽出します。成功個体数を XN とし、
NMN→p(0<p<1)とします。N→∞ のとき、XN が Bin(k,p) に分布収束することを示してください。
解答・解説を開く
最初の一歩元の統計量、中心化、尺度化、使う定理とその条件の順に整理します。近似では標本数や独立性などの条件も答案に添えます。
x=0,1,…,k に対して、超幾何分布の確率関数は、下降階乗 (a)r=a(a−1)⋯(a−r+1) を使うと、
P(XN=x)=(xk)(N)k(MN)x(N−MN)k−xと書けます。k と x は固定されているので、各因子を N で割ると、
Nx(MN)x=j=0∏x−1(NMN−Nj)→pxです。同様に、
Nk−x(N−MN)k−x→(1−p)k−x,Nk(N)k→1.したがって、
P(XN=x)→(xk)px(1−p)k−x.右辺は Bin(k,p) の確率関数なので、
XNdBin(k,p)です。有限母集団に比べて抽出割合 k/N が小さくなると、非復元抽出による依存が無視できるようになる、と解釈できます。
答案で気をつけることこの極限では抽出数 k を固定します。k も N とともに増える場合は同じ証明をそのまま使えません。また、有限の各 x で確率関数の極限を示した後、右辺の総和が1であることを確認すると結論が明確です。
問題15:対数変換で分布と積率を見抜く
この問題を含む「第三章 さまざまな確率分布」の解説へ
- Y∼N(μ,σ2)、X=eY とします。X の平均と分散を求めてください。
- V の密度が
fV(v)=vb+1bab(v≥a),a>0, b>0であるとします。W=log(V/a) の分布を求め、E[Vr] が存在する条件と値を求めてください。
解答・解説を開く
最初の一歩まず変換後の値が動く範囲を決め、元の変数へ戻す式とヤコビアンを確認します。単調でない変換では、同じ値へ移る元の点をすべて数えます。
正規分布の積率母関数は、
E[etY]=exp(μt+2σ2t2)です。X=eY なので、t=1,2 を代入して、
E[X]=eμ+σ2/2,E[X2]=e2μ+2σ2を得ます。したがって、
Var(X)=e2μ+2σ2−e2μ+σ2=e2μ+σ2(eσ2−1).次に W=log(V/a) とおくと、逆変換は v=aew、Jacobianは dv/dw=aew です。v≥a から w≥0 なので、
fW(w)=fV(aew)aew=(aew)b+1babaew=be−bw(w≥0).よって、W∼Exp(b) です。また、V=aeW より、
E[Vr]=arE[erW]=ar∫0∞be−(b−r)wdw.この積分が収束するのは r<b のときに限り、
E[Vr]=arb−rb(r<b)です。
答案で気をつけること積率の式だけでなく、存在条件まで必ず書きます。対数正規分布では E[etX] という意味の積率母関数は正の t で発散する一方、通常の全ての正の整数次モーメントは存在します。両者を混同しないでください。
問題16:ガンマ積分から正規分布とカイ二乗分布の積率を導く
この問題を含む「第三章 さまざまな確率分布」の解説へ
Z∼N(0,1) とします。r>−1 に対して、
E[∣Z∣r]=π2r/2Γ((r+1)/2)を示してください。さらに、Q∼χν2 に対して、q>−ν/2 なら、
E[Qq]=2qΓ(ν/2)Γ(q+ν/2)となることを示してください。
解答・解説を開く
最初の一歩まず変換後の値が動く範囲を決め、元の変数へ戻す式とヤコビアンを確認します。単調でない変換では、同じ値へ移る元の点をすべて数えます。
標準正規密度の対称性より、
E[∣Z∣r]=2π2∫0∞zre−z2/2dz.u=z2/2 とおくと、z=(2u)1/2、dz=(2u)−1/2du なので、
E[∣Z∣r]=2π2∫0∞(2u)r/2e−u(2u)−1/2du=π2r/2∫0∞u(r+1)/2−1e−udu=π2r/2Γ((r+1)/2).積分原点付近で収束する条件が r>−1 です。
カイ二乗分布の密度は、
fQ(x)=2ν/2Γ(ν/2)xν/2−1e−x/2(x>0)です。したがって、
E[Qq]=2ν/2Γ(ν/2)1∫0∞xq+ν/2−1e−x/2dx.u=x/2 と変換すると、
E[Qq]=2qΓ(ν/2)Γ(q+ν/2).原点付近で積分可能である条件は q+ν/2>0、すなわち q>−ν/2 です。
答案で気をつけることガンマ関数の形に合わせるときは、指数を「形パラメータ minus 1」にそろえます。置換後の微分と2のべきが最も落ちやすい箇所です。負の次数も問われるため、原点付近の積分可能条件を省略しないでください。
発展問題17:ポアソン分布とガンマ分布の裾確率を結ぶ
この問題を含む「第三章 さまざまな確率分布」の解説へ
N∼Poisson(λ) とし、Tm を率1の指数分布に従う独立な待ち時間 m 個の和とします。正の整数 m に対して、
P(N≤m−1)=P(Tm≥λ)を示してください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
Tm は形 m、率1のガンマ分布に従うので、
P(Tm≥λ)=(m−1)!1∫λ∞tm−1e−tdt.ここで、
Im(λ)=∫λ∞tm−1e−tdtとおき、部分積分すると、
Im(λ)=λm−1e−λ+(m−1)Im−1(λ)です。I1(λ)=e−λ から再帰的に展開すると、
Im(λ)=(m−1)!e−λj=0∑m−1j!λj.したがって、
P(Tm≥λ)=e−λj=0∑m−1j!λj=P(N≤m−1).これは「時間 λ までの発生回数が m 回未満」と「m 回目の発生時刻が λ 以降」が同じ事象であることの解析的表現です。
答案で気をつけること対応する事象の向きを確認します。N≤m−1 に対応するのは Tm≥λ であり、下側確率同士ではありません。また、ガンマ分布の第2パラメータが率か尺度かを答案の冒頭で明記してください。
医薬・生命科学の問題(13問)
問題1:分布を選ぶ
この問題を含む「第三章 さまざまな確率分布」の解説へ
次の確率変数について、第一候補となる分布を答えてください。
- 独立な患者50人のうち、特定の副作用が出た人数
- 100本のチューブから非復元で10本を選んだとき、不良チューブが含まれる本数
- 一定面積の培地に生じたコロニー数
- 初めて陽性化合物が見つかるまでの試験回数
- 一定発生率の下で、次の有害事象報告までの時間
- 正規母集団から得た標本平均を、標本標準偏差で標準化した量
解答・解説を開く
最初の一歩値の範囲、数えた値か測った値か、値が生じる仕組みの3点から候補を絞ります。分布名だけでなく、選んだ理由まで言葉にします。
| 問い | 分布 | 判断の中心 |
|---|
| 1 | 二項分布 | 独立な50回の二値試行における成功数 |
| 2 | 超幾何分布 | 有限母集団からの非復元抽出 |
| 3 | ポアソン分布 | 一定領域内の発生回数 |
| 4 | 幾何分布 | 初成功までの試行回数 |
| 5 | 指数分布 | 一定率のポアソン過程における待ち時間 |
| 6 | t分布 | 母分散を標本分散で置き換えた標準化平均 |
ただし、どれも発生過程の仮定を確認する必要があります。
例えば問題3でコロニーが凝集して発生するなら独立発生とは考えにくく、ポアソン分布より負の二項分布が合うことがあります。
問題2:二項分布の基本計算
この問題を含む「第三章 さまざまな確率分布」の解説へ
ある副作用が1人の患者に起こる確率を p=0.10 とします。
患者20人を独立に観察し、副作用が出た人数を X とします。
- X の分布、平均、分散を求めてください。
- 副作用が2人以下に出る確率を求めてください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
20人について、同じ発現確率 0.10 の独立な二値試行を考えるので、
X∼Bin(20,0.10)です。
平均は、
E[X]=np=20×0.10=2です。分散は、
Var(X)=np(1−p)=20×0.10×0.90=1.8です。
2人以下の確率は、
P(X≤2)=P(X=0)+P(X=1)+P(X=2)です。それぞれ、
P(X=0)=(020)(0.1)0(0.9)20=(0.9)20≈0.1216P(X=1)=(120)(0.1)(0.9)19=20×0.1×(0.9)19≈0.2702P(X=2)=(220)(0.1)2(0.9)18=190×0.01×(0.9)18≈0.2852です。したがって、
P(X≤2)≈0.1216+0.2702+0.2852=0.6770となります。
問題3:ポアソン分布と少なくとも1回
この問題を含む「第三章 さまざまな確率分布」の解説へ
ある培養条件で、1視野当たりのコロニー数 X が平均2.5のポアソン分布に従うとします。
- コロニーが少なくとも1個見える確率を求めてください。
- 2個以下である確率を求めてください。
解答・解説を開く別解あり
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
X∼Poisson(2.5)です。
「少なくとも1個」は、0個でない事象なので、余事象を使います。
P(X≥1)=1−P(X=0)=1−e−2.50!2.50=1−e−2.5≈0.9179です。
2個以下の確率は、
P(X≤2)=e−2.5(1+2.5+22.52)です。括弧内は、
1+2.5+26.25=6.625なので、
P(X≤2)=6.625e−2.5≈0.5438です。
別解・別の見方「少なくとも1回」を直接足す代わりに、余事象の「0回」を1から引きます。計算量が少なく、答案でも最も安全な方法です。
問題4:まれな副作用のポアソン近似
この問題を含む「第三章 さまざまな確率分布」の解説へ
ある副作用の発現確率は1人当たり 0.002 です。
1000人中の発現人数 X について、誰にも発現しない確率をポアソン近似で求めてください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
厳密には、
X∼Bin(1000,0.002)です。n が大きく p が小さいので、
λ=np=1000×0.002=2としたポアソン分布で近似します。
X≈Poisson(2)したがって、
P(X=0)≈e−20!20=e−2≈0.1353です。
厳密値は、
(1−0.002)1000=0.9981000≈0.1351であり、よく近似できています。
問題5:幾何分布と無記憶性
この問題を含む「第三章 さまざまな確率分布」の解説へ
1回の化合物スクリーニングで目的活性が見つかる確率を p=0.08 とします。
各試行は独立で、成功確率は一定とします。
- 初成功までの平均試行回数を求めてください。
- 10回試しても見つからない確率を求めてください。
- すでに5回失敗したという条件の下で、さらに10回失敗する確率を求めてください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
初成功までの試行回数を X とすると、
X∼Geo(0.08)です。
平均は、
E[X]=p1=0.081=12.5回です。
10回試しても見つからないことは X>10 なので、
P(X>10)=(1−p)10=0.9210≈0.4344です。
3つ目は、すでに5回失敗し、合計15回まで失敗する条件付き確率です。
P(X>15∣X>5)幾何分布の無記憶性より、
P(X>15∣X>5)=P(X>10)=0.9210≈0.4344です。過去5回の失敗は、成功確率が一定というモデルの下では、今後の成功確率を変えません。
問題6:多項分布とカテゴリ間の共分散
この問題を含む「第三章 さまざまな確率分布」の解説へ
遺伝子型 AA,Aa,aa の確率が、それぞれ 0.25,0.50,0.25 である集団から、独立に10個体を観察します。
- AA が2個体、Aa が5個体、aa が3個体となる確率を求めてください。
- AA の個体数 XAA と Aa の個体数 XAa の共分散を求めてください。
解答・解説を開く
最初の一歩求める量を定義式へ戻します。平均を先に求め、分散では E[X2]−E[X]2、共分散では積の期待値と平均の積を区別します。
個体数ベクトルは、
(XAA,XAa,Xaa)∼Multinomial(10;0.25,0.50,0.25)です。したがって、
P(2,5,3)=2!5!3!10!(0.25)2(0.50)5(0.25)3です。
2!5!3!10!=2520なので、
P(2,5,3)=2520(0.25)5(0.50)5≈0.0769です。
異なるカテゴリ間の共分散は、
Cov(Xi,Xj)=−npipjなので、
Cov(XAA,XAa)=−10×0.25×0.50=−1.25です。合計10個体という制約のため、カテゴリ個数は負に相関します。
問題7:指数分布と待ち時間
この問題を含む「第三章 さまざまな確率分布」の解説へ
ある有害事象報告までの待ち時間 T が、1時間当たりの率 λ=0.2 の指数分布に従うとします。
- 5時間を超えて報告がない確率を求めてください。
- 3時間報告がなかったという条件の下で、合計8時間を超えて報告がない確率を求めてください。
- 待ち時間の中央値を求めてください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
指数分布の生存関数は、
P(T>t)=e−λtです。したがって、
P(T>5)=e−0.2×5=e−1≈0.3679です。
無記憶性より、
P(T>8∣T>3)=P(T>5)≈0.3679です。
中央値 m は、半分の確率で m を超える値なので、
P(T>m)=0.5とおけます。
e−0.2m=0.5両辺の自然対数を取ると、
−0.2m=log0.5=−log2よって、
m=0.2log2≈3.466時間です。
問題8:正規分布による分析値の評価
この問題を含む「第三章 さまざまな確率分布」の解説へ
ある分析法による測定値 X は、平均100、標準偏差4の正規分布に従うとします。
測定値が95以上108以下になる確率を求めてください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
X∼N(100,42)です。下限95を標準化すると、
z1=495−100=−1.25上限108は、
z2=4108−100=2です。したがって、
P(95≤X≤108)=P(−1.25≤Z≤2)=Φ(2)−Φ(−1.25)です。標準正規分布表より、
Φ(2)≈0.9772,Φ(−1.25)≈0.1056なので、
P(95≤X≤108)≈0.8716となります。
問題9:対数正規分布と薬物動態量
この問題を含む「第三章 さまざまな確率分布」の解説へ
薬物動態量 X について、
logX∼N(log20,0.32)とします。対数は自然対数です。
- X の中央値と平均を求めてください。
- P(X>30) を求めてください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
対数正規分布の中央値は、
Median(X)=eμなので、
Median(X)=elog20=20です。
平均は、
E[X]=eμ+σ2/2なので、
E[X]=elog20+0.32/2=20e0.045≈20.92です。右に歪んでいるため、平均は中央値より大きくなります。
次に、
P(X>30)=P(logX>log30)です。標準化すると、
P(X>30)=P(Z>0.3log30−log20)=P(Z>0.3log1.5)0.3log1.5≈1.352より、
P(X>30)≈1−Φ(1.352)≈0.088です。
問題10:ベータ事前分布と副作用率
この問題を含む「第三章 さまざまな確率分布」の解説へ
未知の副作用発現確率 p の事前分布を、
p∼Beta(2,8)とします。新たに20人を観察したところ、6人に副作用が出ました。
- p の事後分布を求めてください。
- 事後平均を求めてください。
- 次の1人に副作用が出る事後予測確率を求めてください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
ベータ事前分布と二項尤度の共役性より、成功数6を α に、失敗数14を β に加えます。
p∣x∼Beta(2+6,8+14)したがって、
p∣x∼Beta(8,22)です。
事後平均は、
E[p∣x]=8+228=308≈0.2667です。
次の1人の副作用指標を Y とすると、p が与えられた下では、
P(Y=1∣p)=pです。全期待値の公式より、
P(Y=1∣x)=E{P(Y=1∣p,x)∣x}=E[p∣x]なので、事後予測確率も、
P(Y=1∣x)≈0.2667です。
事前平均 2/(2+8)=0.20 と、データだけの割合 6/20=0.30 の間に入っていることも確認できます。
問題11:ワイブル分布と時間依存ハザード
この問題を含む「第三章 さまざまな確率分布」の解説へ
ある製剤が規格外となるまでの時間 T が、形状 k=2、尺度 η=100 日のワイブル分布に従うとします。
- 80日を超えて規格内である確率を求めてください。
- 50日目と100日目のハザードを求め、比較してください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
ワイブル分布の生存関数は、
S(t)=exp{−(ηt)k}です。したがって、
P(T>80)=exp{−(10080)2}=e−0.64≈0.5273です。
ハザードは、
h(t)=ηk(ηt)k−1なので、
h(50)=1002(10050)=0.01h(100)=1002(100100)=0.02です。k=2>1 なので、規格外となる瞬間的なリスクは時間とともに増加します。
100日目のハザードは50日目の2倍です。
問題12:過分散からモデルを考える
この問題を含む「第三章 さまざまな確率分布」の解説へ
多数の培養ウェルでコロニー数を数えたところ、標本平均は4、標本分散は12でした。
- ポアソン分布を第一候補としたとき、どの点が気になりますか。
- 負の二項分布の平均と分散を、
E[X]=μ,Var(X)=μ+rμ2と表すとします。μ=4、分散12に合う r を求めてください。
解答・解説を開く
最初の一歩求める量を定義式へ戻します。平均を先に求め、分散では E[X2]−E[X]2、共分散では積の期待値と平均の積を区別します。
ポアソン分布では、
E[X]=Var(X)=λです。しかしデータでは、
平均=4,分散=12であり、分散が平均の3倍です。
これは過分散のサインです。
考えられる原因には、ウェル間の細胞密度差、バッチ差、コロニーの凝集、観測されない異質性などがあります。
負の二項分布の分散式に代入すると、
12=4+r42です。したがって、
8=r16両辺に r を掛けて8で割ると、
r=2です。
ただし、標本平均と標本分散だけでモデルを確定はできません。
ヒストグラム、ゼロの個数、外れた大カウント、実験デザインを合わせて確認します。
発展 問題13:ゼロ過剰ポアソン分布
この問題を含む「第三章 さまざまな確率分布」の解説へ
確率 π=0.4 で構造的に0となり、それ以外では平均 λ=3 のポアソン分布に従うとします。
- P(X=0) を求めてください。
- E[X] と Var(X) を求めてください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
0は「構造的な0」と「ポアソン分布から生じる0」の2経路で起こります。
P(X=0)=0.4+0.6e−3≈0.4299です。
平均は、
E[X]=(1−π)λ=0.6×3=1.8です。分散は、
Var(X)=(1−π)λ+π(1−π)λ2に代入して、
Var(X)=0.6×3+0.4×0.6×32=1.8+2.16=3.96です。平均1.8より分散3.96が大きく、ゼロ過剰が過分散を生むことが分かります。
数理統計問題(22問)
問題1:同時確率表
この問題を含む「第四章 多次元確率変数の分布」の解説へ
同時確率が次で与えられます。
| Y=0 | Y=1 |
|---|
| X=0 | 0.42 | 0.08 |
| X=1 | 0.18 | 0.32 |
次を求めてください。
- P(X=1) と P(Y=1)
- P(Y=1∣X=1)
- X,Y は独立か
- Cov(X,Y) と相関係数
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
周辺確率は行・列を足して、
P(X=1)=0.18+0.32=0.50P(Y=1)=0.08+0.32=0.40です。条件付き確率は、
P(Y=1∣X=1)=0.500.32=0.64です。独立なら P(X=1,Y=1)=0.50×0.40=0.20 ですが、実際は0.32なので独立ではありません。
二値変数なので、
E[XY]=P(X=1,Y=1)=0.32です。したがって、
Cov(X,Y)=0.32−0.50×0.40=0.12です。また、
Var(X)=0.5(1−0.5)=0.25Var(Y)=0.4(1−0.4)=0.24なので、
Corr(X,Y)=0.25×0.240.12≈0.490です。
問題2:三角形の台
この問題を含む「第四章 多次元確率変数の分布」の解説へ
fX,Y(x,y)=c(0<x<y<1)が同時密度となるように c を定め、周辺密度 fX(x),fY(y) と条件付き密度 fX∣Y(x∣y) を求めてください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
正規化より、
1=∫01∫0ycdxdy=2cなので c=2 です。
fX(x)=∫x12dy=2(1−x)(0<x<1)fY(y)=∫0y2dx=2y(0<y<1)です。したがって、
fX∣Y(x∣y)=2y2=y1(0<x<y)です。
問題3:条件付き期待値
この問題を含む「第四章 多次元確率変数の分布」の解説へ
問題1の表について、E[Y∣X] と E{E[Y∣X]} を求めてください。
解答・解説を開く
最初の一歩条件として分かっている情報を分母に置きます。文章のまま計算せず、分子と分母がどの事象かを先に書くと混乱しません。
E[Y∣X=0]=P(Y=1∣X=0)=0.500.08=0.16E[Y∣X=1]=0.64です。したがって、
E{E[Y∣X]}=0.50×0.16+0.50×0.64=0.40となり、E[Y]=P(Y=1)=0.40 と一致します。
問題4:全分散の公式
この問題を含む「第四章 多次元確率変数の分布」の解説へ
問題1の表について、全分散の公式を使って Var(Y) を求めてください。
解答・解説を開く
最初の一歩求める量を定義式へ戻します。平均を先に求め、分散では E[X2]−E[X]2、共分散では積の期待値と平均の積を区別します。
条件付き分散は、
Var(Y∣X=0)=0.16(1−0.16)=0.1344Var(Y∣X=1)=0.64(1−0.64)=0.2304です。よって、
E{Var(Y∣X)}=0.5(0.1344)+0.5(0.2304)=0.1824です。条件付き平均は0.16と0.64で、全体平均は0.40なので、
Var{E[Y∣X]}=0.5(0.16−0.40)2+0.5(0.64−0.40)2=0.0576です。したがって、
Var(Y)=0.1824+0.0576=0.24となり、ベルヌーイ分散 0.4(1−0.4) と一致します。
問題5:線形結合の平均と分散
この問題を含む「第四章 多次元確率変数の分布」の解説へ
E[X]=2,E[Y]=3,Var(X)=4,Var(Y)=9,Cov(X,Y)=3とします。S=2X−Y の平均と分散を求めてください。
解答・解説を開く別解あり
最初の一歩求める量を定義式へ戻します。平均を先に求め、分散では E[X2]−E[X]2、共分散では積の期待値と平均の積を区別します。
E[S]=2E[X]−E[Y]=4−3=1です。分散は、
Var(2X−Y)=4Var(X)+Var(Y)−4Cov(X,Y)=4×4+9−4×3=13です。係数の積 2×(−1) を2倍して、共分散項が −4Cov(X,Y) となる点に注意します。
別解・別の見方成分表示で共分散項まで展開する方法と、係数ベクトル a を使って operatornameVar(aTX)=aTSigmaa と計算する方法の2通りがあります。
問題6:離散畳み込み
この問題を含む「第四章 多次元確率変数の分布」の解説へ
独立な確率変数 X,Y が、
P(X=0)=P(Y=0)=21,P(X=1)=P(Y=1)=21を満たします。S=X+Y の分布を求めてください。
解答・解説を開く別解あり
最初の一歩独立性と共分散の有無を確認してから、和の確率、畳み込み、または線形結合の公式を選びます。
P(S=0)=P(X=0,Y=0)=41P(S=1)=P(0,1)+P(1,0)=41+41=21P(S=2)=P(1,1)=41です。したがって S∼Bin(2,1/2) です。
別解・別の見方確率母関数が使える離散分布なら、各変数の母関数を掛け、積を展開して和の確率を読み取る方法もあります。
問題7:一様分布の和
この問題を含む「第四章 多次元確率変数の分布」の解説へ
X,Y は独立に U(0,1) に従います。S=X+Y の密度を求めてください。
解答・解説を開く別解あり
最初の一歩独立性と共分散の有無を確認してから、和の確率、畳み込み、または線形結合の公式を選びます。
畳み込みより、
fS(s)=∫fX(x)fY(s−x)dxです。積分される値が1になるには、
0<x<1,0<s−x<1が必要です。
0<s<1 では 0<x<s なので、
fS(s)=∫0s1dx=sです。1≤s<2 では s−1<x<1 なので、
fS(s)=∫s−111dx=2−sです。したがって、
fS(s)=⎩⎨⎧s2−s0(0<s<1)(1≤s<2)(otherwise)です。
別解・別の見方畳み込み積分の代わりに、単位正方形の中で x+ylez を満たす領域の面積を求めても分布関数が得られます。
問題8:指数分布の和
この問題を含む「第四章 多次元確率変数の分布」の解説へ
X,Y は独立に率 λ の指数分布に従います。S=X+Y の密度を畳み込みで求めてください。
解答・解説を開く
最初の一歩独立性と共分散の有無を確認してから、和の確率、畳み込み、または線形結合の公式を選びます。
s>0 で、
fS(s)=∫0sλe−λxλe−λ(s−x)dx=λ2e−λs∫0s1dx=λ2se−λsです。これは形状2、率 λ のガンマ分布です。
問題9:和と比への変換
この問題を含む「第四章 多次元確率変数の分布」の解説へ
X,Y は独立に率1の指数分布に従います。
S=X+Y,U=X+YXとします。(S,U) の同時密度を求め、S,U が独立であることを示してください。
解答・解説を開く
最初の一歩まず変換後の値が動く範囲を決め、元の変数へ戻す式とヤコビアンを確認します。単調でない変換では、同じ値へ移る元の点をすべて数えます。
逆変換は、
X=SU,Y=S(1−U)です。台は、
s>0,0<u<1です。ヤコビアンは、
∂(s,u)∂(x,y)=u1−us−s=sです。したがって、
fS,U(s,u)=e−sue−s(1−u)s=se−sです。これは、
{se−s}×1と分解できるので、
S∼Gamma(2,rate 1),U∼U(0,1)であり、S,U は独立です。
問題10:Box–Muller変換
この問題を含む「第四章 多次元確率変数の分布」の解説へ
U1=e−1,U2=81について、次を求めてください。
- 半径 R と角度 Θ
- Box–Muller変換後の Z1,Z2
- Z12+Z22=−2logU1 が成り立つことの確認
- U1 と U2 がそれぞれ変換後の点の何を決めているか
- 極座標から直交座標へのヤコビアンの絶対値
- (U1,U2) から (Z1,Z2) への変換全体のヤコビアンと、その逆数
解答・解説を開く別解あり
最初の一歩まず変換後の値が動く範囲を決め、元の変数へ戻す式とヤコビアンを確認します。単調でない変換では、同じ値へ移る元の点をすべて数えます。
半径は、
R=−2log(e−1)=2です。角度は、
Θ=2π×81=4πです。したがって、
Z1=2cos4π=1Z2=2sin4π=1です。
平方和を計算すると、
Z12+Z22=12+12=2です。一方、
−2logU1=−2log(e−1)=2なので、
Z12+Z22=−2logU1を確認できます。
U1 は、
R=−2logU1を通して原点からの距離を決めます。U1 が0へ近づくほど R は大きくなります。
U2 は、
Θ=2πU2を通して方向を決め、半径は変えません。
極座標から直交座標へのヤコビアンは、
∂(r,θ)∂(z1,z2)=rです。この問題では R=2 なので、
∂(r,θ)∂(z1,z2)=2です。これは (R,Θ) 空間の微小長方形 dR,dΘ が、(Z1,Z2) 平面で面積約 2,dR,dΘ の扇形へ変わることを表します。
変換全体のヤコビアンは、
∂(u1,u2)∂(z1,z2)=u12πでした。u1=e−1 を代入すると、
∂(u1,u2)∂(z1,z2)=2πeです。密度変換で (Z1,Z2) の密度を求めるときに使う逆向きのヤコビアンは、
∂(z1,z2)∂(u1,u2)=2πe1です。
別解・別の見方逆変換全体のヤコビアンを計算する方法のほか、二変量標準正規密度を極座標に直し、半径と角度が独立になることから導く方法があります。
問題11:多項分布の確率
この問題を含む「第四章 多次元確率変数の分布」の解説へ
細胞の表現型がA、B、Cに分類される確率を、
(pA,pB,pC)=(0.5,0.3,0.2)とします。独立に10細胞を観察したとき、個数が (5,3,2) となる確率を求めてください。
解答・解説を開く
最初の一歩独立性と共分散の有無を確認してから、和の確率、畳み込み、または線形結合の公式を選びます。
P(NA=5,NB=3,NC=2)=5!3!2!10!(0.5)5(0.3)3(0.2)2です。多項係数は、
5!3!2!10!=2520なので、
2520(0.5)5(0.3)3(0.2)2≈0.0851です。
問題12:多項分布の共分散
この問題を含む「第四章 多次元確率変数の分布」の解説へ
問題11で、E[NA]、Var(NA)、Cov(NA,NB) を求めてください。
解答・解説を開く
最初の一歩求める量を定義式へ戻します。平均を先に求め、分散では E[X2]−E[X]2、共分散では積の期待値と平均の積を区別します。
E[NA]=npA=10×0.5=5Var(NA)=npA(1−pA)=10×0.5×0.5=2.5Cov(NA,NB)=−npApB=−10×0.5×0.3=−1.5です。合計細胞数が固定されているため、カテゴリ間の共分散は負です。
問題13:多変量正規分布の線形結合
この問題を含む「第四章 多次元確率変数の分布」の解説へ
(XY)∼N2[(1020),(4339)]とします。S=X+2Y の分布を求めてください。
解答・解説を開く別解あり
最初の一歩独立性と共分散の有無を確認してから、和の確率、畳み込み、または線形結合の公式を選びます。
平均は、
E[S]=10+2×20=50です。a=(1,2)T とすると、
Var(S)=aTΣa=12×4+22×9+2×1×2×3=52です。したがって、
S∼N(50,52)です。
別解・別の見方行列公式 aTSigmaa を使う方法と、分散の加法公式を成分ごとに展開する方法があります。後者は共分散項の意味を確認しやすい方法です。
問題14:二変量正規の条件付き分布
この問題を含む「第四章 多次元確率変数の分布」の解説へ
X,Y は平均0、分散1、相関係数 ρ=0.8 の二変量正規分布に従います。
X=1.5 のときの Y の条件付き分布を求めてください。
解答・解説を開く
最初の一歩条件として分かっている情報を分母に置きます。文章のまま計算せず、分子と分母がどの事象かを先に書くと混乱しません。
E[Y∣X=1.5]=ρx=0.8×1.5=1.2Var(Y∣X=1.5)=1−ρ2=1−0.64=0.36なので、
Y∣X=1.5∼N(1.2,0.36)です。
問題15:2成分混合分布
この問題を含む「第四章 多次元確率変数の分布」の解説へ
確率0.7で N(0,1)、確率0.3で N(4,1) から値を生成します。
混合分布の平均と分散を求めてください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
平均は、
μ=0.7×0+0.3×4=1.2です。群内分散の平均は、
0.7×1+0.3×1=1です。群間平均による分散は、
0.7(0−1.2)2+0.3(4−1.2)2=3.36です。したがって、
Var(X)=1+3.36=4.36です。
問題16:同じユークリッド距離、異なるマハラノビス距離
この問題を含む「第四章 多次元確率変数の分布」の解説へ
平均ベクトルが 0、各変数の分散が1、相関係数が ρ=0.8 の二変量正規分布を考えます。
次の2点について、原点からのユークリッド距離とマハラノビス距離の2乗を求めてください。
xA=(2,2)⊤,xB=(2,−2)⊤さらに、自由度2のカイ二乗分布の上側5%点 5.991 と比較し、どちらが95%確率楕円の外側にあるか説明してください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
どちらの点もユークリッド距離は、
∥xA∥2=∥xB∥2=22+22=8であり、原点からの直線距離だけでは区別できません。
各変数の標準偏差が1なので、マハラノビス距離の2乗は、
D2=1−ρ2x12−2ρx1x2+x22です。xA=(2,2)⊤ では、
DA2=1−0.8222−2(0.8)(2)(2)+22=0.368−6.4=0.361.6≈4.44です。一方、xB=(2,−2)⊤ では、
DB2=1−0.8222−2(0.8)(2)(−2)+(−2)2=0.368+6.4=0.3614.4=40です。したがって、
DA2=4.44<5.991,DB2=40>5.991より、xA は95%確率楕円の内側、xB は外側です。
正の相関が強い集団では「両方とも高い」は起こりやすい一方、「片方が高く、もう片方が低い」は非常に起こりにくいためです。
問題17:階層モデルの分散、ICC、部分プーリング
この問題を含む「第四章 多次元確率変数の分布」の解説へ
次の正規階層モデルを考えます。
Yij=μ+ui+εijui∼N(0,0.64),εij∼N(0,1.44)各群の標本数は ni=4、全体平均は μ=1 とします。ある群の標本平均が Yˉi=3 でした。
- Yij の分散
- 同じ群内の2観測の共分散
- ICC
- 部分プーリング後の群平均
を求めてください。
解答・解説を開く
最初の一歩求める量を定義式へ戻します。平均を先に求め、分散では E[X2]−E[X]2、共分散では積の期待値と平均の積を区別します。
群間分散は τ2=0.64、群内分散は σ2=1.44 です。
観測値の分散は、
Var(Yij)=Var(ui)+Var(εij)=0.64+1.44=2.08です。
同じ群の2観測は ui を共有するため、
Cov(Yij,Yik)=Var(ui)=0.64です。したがってICCは、
ICC=τ2+σ2τ2=0.64+1.440.64=2.080.64≈0.308です。
部分プーリングで群自身の平均に掛かる重みは、
Bi=niτ2+σ2niτ2=4(0.64)+1.444(0.64)=4.002.56=0.64です。したがって、
E[θi∣Yˉi]=BiYˉi+(1−Bi)μ=0.64(3)+0.36(1)=1.92+0.36=2.28です。生の群平均3をそのまま採用せず、標本数と分散成分に応じて全体平均1の方向へ縮めています。
問題18:Cauchy—Schwarzの不等式を二次式から導く
この問題を含む「第四章 多次元確率変数の分布」の解説へ
E[X2]<∞、E[Y2]<∞ とします。二次式
h(t)=E[{(X−E[X])−t(Y−E[Y])}2]を用いて、
∣Cov(X,Y)∣≤Var(X)Var(Y)を示し、等号成立条件を答えてください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
U=X−E[X]、V=Y−E[Y] とおくと、
h(t)=E[(U−tV)2]=Var(X)−2tCov(X,Y)+t2Var(Y).h(t) は平方の期待値なので、すべての t に対して非負です。Var(Y)>0 のとき、平方完成すると、
h(t)=Var(Y)(t−Var(Y)Cov(X,Y))2+Var(X)−Var(Y)Cov(X,Y)2.最小値も非負なので、
Cov(X,Y)2≤Var(X)Var(Y).両辺の平方根を取れば目的の不等式を得ます。
等号が成立するのは最小値が0、すなわち、ある定数 c が存在して、
X−E[X]=c{Y−E[Y]}a.s.となるときです。どちらかの分散が0の場合も等号になります。
答案で気をつけること相関係数の範囲だけを書くのではなく、非負な二次式を明示します。等号条件は単なる「線形関係」ではなく、中心化した変数がほとんど確実に比例することです。
問題19:条件付き期待値は残差と直交する
この問題を含む「第四章 多次元確率変数の分布」の解説へ
X,Y は二乗可積分とし、
R=Y−E[Y∣X]とおきます。次を示してください。
- Cov(X,R)=0
- Var(R)=E[Var(Y∣X)]
解答・解説を開く
最初の一歩条件として分かっている情報を分母に置きます。文章のまま計算せず、分子と分母がどの事象かを先に書くと混乱しません。
まず、条件付き期待値の定義から、
E[R∣X]=E[Y∣X]−E[Y∣X]=0.したがって、反復期待値の法則により、
E[R]=E[E[R∣X]]=0です。また、X は X の関数なので条件の外へ出せます。
E[XR]=E[E[XR∣X]]=E[XE[R∣X]]=0.よって、
Cov(X,R)=E[XR]−E[X]E[R]=0.次に、E[R∣X]=0 なので、
Var(R)=E[R2].条件付きで見ると E[Y∣X] は定数であるため、
E[R2∣X]=E[{Y−E[Y∣X]}2∣X]=Var(Y∣X).再び期待値を取れば、
Var(R)=E[Var(Y∣X)]です。これは回帰における「説明できなかったばらつき」に対応します。
答案で気をつけること無相関を示すには E[XR]=0 だけでなく E[R]=0 も確認します。また、残差が X と無相関でも、一般には独立とは限りません。独立まで言えるのは、たとえば同時正規性など追加条件がある場合です。
問題20:カイ二乗分布の和と比を同時変換する
この問題を含む「第四章 多次元確率変数の分布」の解説へ
独立な確率変数
A∼χm2,B∼χn2に対して、
S=A+B,R=A+BAとおきます。(S,R) の同時密度を求め、S と R の分布および独立性を示してください。
解答・解説を開く
最初の一歩まず変換後の値が動く範囲を決め、元の変数へ戻す式とヤコビアンを確認します。単調でない変換では、同じ値へ移る元の点をすべて数えます。
逆変換は、
A=RS,B=(1−R)Sであり、台は s>0、0<r<1 です。Jacobianは、
∂(s,r)∂(a,b)=r1−rs−s=s.独立性とカイ二乗密度を使うと、
fS,R(s,r)=2(m+n)/2Γ(m/2)Γ(n/2)(rs)m/2−1{(1−r)s}n/2−1e−s/2s={2(m+n)/2Γ((m+n)/2)s(m+n)/2−1e−s/2}×{Γ(m/2)Γ(n/2)Γ((m+n)/2)rm/2−1(1−r)n/2−1}.同時密度が s だけの密度と r だけの密度の積に分解できたので、
S∼χm+n2,R∼Beta(2m,2n),S⊥Rです。
答案で気をつけること多変量変換は、逆変換、変換後の台、Jacobianの絶対値の順で書きます。独立性は「形が似ている」ではなく、同時密度が周辺密度の積に因数分解されたことから結論します。
問題21:全共分散の公式と潜在変数による相関
この問題を含む「第四章 多次元確率変数の分布」の解説へ
- 次の全共分散の公式を示してください。
Cov(X,Y)=E[Cov(X,Y∣Z)]+Cov(E[X∣Z],E[Y∣Z])
- Z∼N(0,τ2) とし、Z を与えたとき X,Y は独立に、
X∣Z∼N(Z,σ2),Y∣Z∼N(Z,σ2)に従うとします。Cov(X,Y) と相関係数を求めてください。
解答・解説を開く
最初の一歩求める量を定義式へ戻します。平均を先に求め、分散では E[X2]−E[X]2、共分散では積の期待値と平均の積を区別します。
条件付き共分散の定義から、
E[XY∣Z]=Cov(X,Y∣Z)+E[X∣Z]E[Y∣Z]です。両辺の期待値を取り、E[XY]−E[X]E[Y] を作ると、
Cov(X,Y)=E[Cov(X,Y∣Z)]+E[E[X∣Z]E[Y∣Z]]−E[X]E[Y]=E[Cov(X,Y∣Z)]+Cov(E[X∣Z],E[Y∣Z]).階層モデルでは、条件付き独立性より、
Cov(X,Y∣Z)=0です。一方、E[X∣Z]=E[Y∣Z]=Z なので、
Cov(X,Y)=Var(Z)=τ2.また、全分散の公式より、
Var(X)=E[σ2]+Var(Z)=σ2+τ2で、Y も同じです。したがって、
Corr(X,Y)=σ2+τ2τ2.条件付きでは独立でも、共通の潜在変数を周辺化すると正の相関が生じます。
答案で気をつけること「条件付き独立だから独立」と結論しないでください。条件付き共分散が0でも、条件付き平均が共通因子とともに動くと、第2項によって周辺共分散が生じます。
発展問題22:Dirichlet分布の周辺・条件付き分布
この問題を含む「第四章 多次元確率変数の分布」の解説へ
(P1,P2,P3)∼Dirichlet(a,b,c) とし、P1+P2+P3=1 とします。
- P1 の周辺分布を求めてください。
- U=P2/(1−P1) の分布を求め、P1 と U が独立であることを示してください。
- Cov(P1,P2) を求めてください。
解答・解説を開く
最初の一歩条件として分かっている情報を分母に置きます。文章のまま計算せず、分子と分母がどの事象かを先に書くと混乱しません。
x=P1、u=P2/(1−P1) とおくと、
P2=(1−x)u,P3=(1−x)(1−u)です。台は 0<x<1、0<u<1 で、(P1,P2) から (x,u) への逆変換のJacobianは、
∂(x,u)∂(P1,P2)=1−xです。Dirichlet密度に代入すると、
fP1,U(x,u)=Γ(a)Γ(b)Γ(c)Γ(a+b+c)xa−1{(1−x)u}b−1×{(1−x)(1−u)}c−1(1−x)={B(a,b+c)xa−1(1−x)b+c−1}{B(b,c)ub−1(1−u)c−1}.したがって、
P1∼Beta(a,b+c),U∼Beta(b,c),P1⊥U.α0=a+b+c とおくと、Dirichlet分布の積率は、
E[P1]=α0a,E[P2]=α0b,E[P1P2]=α0(α0+1)abなので、
Cov(P1,P2)=−α02(α0+1)ab.成分和が1に固定されるため、1成分が増えると他成分に負の共分散が生じます。
答案で気をつけることDirichlet分布は3変数を自由に積分する分布ではなく、単体 p1+p2+p3=1 上の分布です。独立性を示す変換ではJacobianの 1−x を落とさず、共分散の負号を組成制約と結びつけて確認します。
医薬・生命科学の問題(8問)
問題1:バイオマーカー層別と全分散
この問題を含む「第四章 多次元確率変数の分布」の解説へ
患者の30%がバイオマーカー陽性です。
陽性群の薬効スコアの平均・分散はそれぞれ8、4、陰性群ではそれぞれ5、9とします。
全患者での平均と分散を求めてください。
解答・解説を開く
最初の一歩求める量を定義式へ戻します。平均を先に求め、分散では E[X2]−E[X]2、共分散では積の期待値と平均の積を区別します。
陽性を Z=1 とすると、
E[Y]=0.3×8+0.7×5=5.9です。群内分散の平均は、
E{Var(Y∣Z)}=0.3×4+0.7×9=7.5です。群間平均の分散は、
Var{E[Y∣Z]}=0.3(8−5.9)2+0.7(5−5.9)2=1.89です。したがって、
Var(Y)=7.5+1.89=9.39です。
問題2:有害事象グレードの多項分布
この問題を含む「第四章 多次元確率変数の分布」の解説へ
100人の患者について、有害事象なし、軽度、中等度、重度の確率が、
(0.55,0.25,0.15,0.05)とします。
- 重度の人数 N4 の平均と分散
- 中等度以上の人数 N3+N4 の分布
- 軽度と重度の人数の共分散
を求めてください。
解答・解説を開く
最初の一歩独立性と共分散の有無を確認してから、和の確率、畳み込み、または線形結合の公式を選びます。
重度の人数の周辺分布は、
N4∼Bin(100,0.05)なので、
E[N4]=5,Var(N4)=100(0.05)(0.95)=4.75です。
中等度以上の確率は、
0.15+0.05=0.20なので、
N3+N4∼Bin(100,0.20)です。軽度と重度の共分散は、
Cov(N2,N4)=−100(0.25)(0.05)=−1.25です。
問題3:階層構造と疑似反復
この問題を含む「第四章 多次元確率変数の分布」の解説へ
薬剤群3匹、対照群3匹のマウスから、それぞれ100細胞を測定しました。
600細胞を独立標本として2群比較する解析の問題点を説明し、適切な解析単位とモデル案を示してください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
同じマウス由来の100細胞は、遺伝背景、処置、組織環境、標本作製条件を共有するため独立ではありません。
600細胞を独立標本とみなすと、実際の独立単位より標本数を過大に数え、標準誤差を過小評価する疑似反復になります。
処置がマウスに割り付けられているなら、処置効果の独立な反復単位は基本的にマウスです。
解析案としては、
- マウスごとに細胞測定値を要約し、n=3 対 n=3 として比較する
- 細胞をレベル1、マウスをレベル2とする混合効果モデルを用いる
- 細胞型やバッチがあるなら、研究目的とデザインに応じて追加階層を組み込む
ことが考えられます。
細胞数を増やすことは各マウス内の推定精度を高めますが、マウス数を増やすことと同じではありません。
発展 問題4:ベータ二項分布の過分散
この問題を含む「第四章 多次元確率変数の分布」の解説へ
施設ごとの有害事象発現確率が、
P∼Beta(4,16)に従い、各施設で n=20 人を観察するとします。
施設ごとの発現人数 Y の平均と分散を求め、成功確率を固定した二項分布と比較してください。
解答・解説を開く
最初の一歩求める量を定義式へ戻します。平均を先に求め、分散では E[X2]−E[X]2、共分散では積の期待値と平均の積を区別します。
μ=4+164=0.2,κ=20です。平均は、
E[Y]=nμ=20×0.2=4です。ベータ二項分布の分散は、
Var(Y)=nμ(1−μ)×κ+1κ+n=20(0.2)(0.8)×20+120+20≈6.095です。一方、成功確率を0.2に固定した二項分布の分散は、
20(0.2)(0.8)=3.2です。施設ごとの発現確率の違いにより、分散が約1.90倍になっています。
発展 問題5:多変量バイオマーカーの条件付き予測
この問題を含む「第四章 多次元確率変数の分布」の解説へ
標準化した2つのバイオマーカー X,Y が相関0.6の二変量正規分布に従うとします。
- X=2 の患者における Y の条件付き平均と分散
- 条件付け前後で分散が何%減少するか
を求めてください。
解答・解説を開く
最初の一歩条件として分かっている情報を分母に置きます。文章のまま計算せず、分子と分母がどの事象かを先に書くと混乱しません。
Y∣X=2∼N(0.6×2,1−0.62)=N(1.2,0.64)です。したがって条件付き平均は1.2、分散は0.64です。
条件付け前の分散は1なので、分散の減少率は、
11−0.64×100=36%です。
これは相関があるとき、X の情報が Y の予測不確実性を減らすことを表します。
ただし、予測精度の評価には、正規性、線形性、外部検証、測定誤差も確認する必要があります。
発展 問題6:AUCとCmaxの組み合わせ異常
この問題を含む「第四章 多次元確率変数の分布」の解説へ
ある薬物動態試験で、用量補正後の log(AUC) と log(Cmax) を標準化した値をそれぞれ X,Y とします。
基準集団では平均がともに0、分散がともに1、相関係数が ρ=0.7 でした。
ある被験者の観測値が、
(X,Y)=(1.5,−1.0)であったとします。
- この被験者のマハラノビス距離の2乗 D2 を求めてください。
- 二変量正規分布を仮定し、χ22 の上側5%点 5.991 と比較してください。
- 実データで確認すべき項目を3つ以上挙げてください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
標準化済みなので、
D2=1−ρ2X2−2ρXY+Y2を使います。値を代入すると、
D2=1−0.721.52−2(0.7)(1.5)(−1.0)+(−1.0)2=0.512.25+2.10+1.00=0.515.35≈10.49したがって、
D≈10.49≈3.24です。また、
D2=10.49>5.991なので、この点は基準集団の95%確率楕円の外側にあります。
AUCが高い一方で Cmax が低いという組み合わせは、正の相関をもつ基準集団では起こりにくいと解釈できます。
ただし、これだけで「異常な薬物動態」や「疾患による変化」と断定してはいけません。少なくとも次を確認します。
- 投与量、服薬遵守、投与・採血時刻の記録
- 単位、転記、欠測補完、用量補正などのデータ処理
- 測定法の定量下限、精度管理、バッチ効果
- 吸収速度、製剤、食事、併用薬などの臨床条件
- 腎機能、肝機能、体重、遺伝型などの患者背景
- 基準集団の選び方、正規性、共分散行列の推定精度
マハラノビス距離は、確認すべき症例を見つけるスクリーニング指標です。原因を特定する指標ではないため、記録・測定・生物学的背景を順に検証します。
問題7:混合分布か階層モデルか
この問題を含む「第四章 多次元確率変数の分布」の解説へ
次の研究場面で、混合分布、階層モデル、または両方のどれを考えるべきか答え、理由を説明してください。
- 由来不明の細胞1000個について薬剤応答量だけがあり、感受性群と耐性群の混在を調べたい
- 6匹のマウスから各500細胞を測定し、マウスIDが記録されている
- 10施設の患者を追跡し、施設内にもレスポンダーと非レスポンダーがいる可能性がある
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
1では、各細胞の表現型ラベルが観測されておらず、未知の感受性群・耐性群を推定したいので混合分布が候補です。ただし、二峰性だけで生物学的表現型を断定せず、マーカーや機能試験で検証します。
2では、細胞がどのマウスに由来するか既知であり、細胞がマウス内に入れ子になっているので階層モデルが候補です。500細胞を500匹の独立マウスとして扱ってはいけません。処置効果の一般化対象がマウスなら、独立単位は基本的に6匹です。
3では、患者が施設内に入れ子になっているため施設差を扱う階層モデルが必要です。さらに、施設内で所属不明のレスポンダー・非レスポンダーが混在すると仮定するなら、潜在クラスをもつ混合分布も組み合わせることになります。
実際のモデル選択では、次を順に確認します。
- 所属IDが観測されている階層は何か
- 未観測のサブタイプを仮定する根拠があるか
- 独立な実験単位は患者、個体、施設のどれか
- 技術反復と生物学的反復を区別できているか
- 複雑なモデルを支える標本数と検証データがあるか
発展 問題8:毒性予測と適用領域
この問題を含む「第四章 多次元確率変数の分布」の解説へ
標準化した2つの化学記述子 X1,X2 の学習データで、平均がともに0、分散がともに1、相関係数が ρ=0.65 だったとします。
候補化合物の記述子が、
(X1,X2)=(1.5,−1.0)であり、説明用の仮想毒性モデルが、
logit{P(毒性)}=−0.3+0.9X1−0.6X2であったとします。
- マハラノビス距離の2乗 D2 を求めてください。
- χ22 の95%点 5.991 と比較してください。
- 仮想モデルの毒性確率を求めてください。
- この候補化合物について、どのように報告し、何を追加確認すべきか説明してください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
マハラノビス距離の2乗は、
D2=1−ρ2x12−2ρx1x2+x22です。値を代入すると、
D2=1−0.6521.52−2(0.65)(1.5)(−1.0)+(−1.0)2=0.57752.25+1.95+1.00=0.57755.20≈9.00です。
D2≈9.00>5.991なので、二変量正規分布と母数既知を仮定した95%化学空間の外側です。
仮想毒性モデルの線形予測子は、
η=−0.3+0.9(1.5)−0.6(−1.0)=−0.3+1.35+0.60=1.65です。したがって、
P(毒性)=1+e−1.651≈0.839です。
報告では、
仮想モデルは毒性確率約83.9%を出力したが、候補化合物はマハラノビス距離による95%適用領域外であり、外挿予測である
と、予測値と適用領域を分けて記載します。
少なくとも次を確認します。
- 学習データ中の近傍化合物と構造類似性
- 毒性エンドポイントの定義、ラベル品質、クラス不均衡
- 構造アラート、反応性官能基、代謝活性化の可能性
- in vitro assayの濃度反応、細胞毒性、測定干渉
- 別モデル、read-across、外部データによる予測の再現性
- 実験確認の優先順位と、ヒト曝露量との関係
高い予測値を無視してはいけませんが、「83.9%を高精度に信頼できる」とも結論できません。適用領域外という情報を、追加評価を優先する警告として使います。
数学コラム確認問題(12問)
問題1:指示関数
この問題を含む「数学コラム 必要な数学の確認」の解説へ
事象 A,B について、
IA∪B=IA+IB−IAIBを用いて、P(A∪B) の公式を導いてください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
両辺の期待値を取ると、E[IA]=P(A)、IAIB=IA∩B より、
P(A∪B)=P(A)+P(B)−P(A∩B)です。
問題2:二項係数の和
この問題を含む「数学コラム 必要な数学の確認」の解説へ
r=0∑n(rn)を求めてください。
解答・解説を開く別解あり
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
二項定理で a=b=1 とすると、
(1+1)n=r=0∑n(rn)1n−r1rなので、
r=0∑n(rn)=2nです。
別解・別の見方二項定理で x=1 を代入する方法のほか、n 個の要素から作れる全部分集合を大きさ別に数える組合せ論的な方法があります。
問題3:等比級数の微分
この問題を含む「数学コラム 必要な数学の確認」の解説へ
∣s∣<1 で、
k=0∑∞sk=1−s1を微分し、∑k=1∞ksk−1 を求めてください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
収束半径の内部で項別微分すると、
k=1∑∞ksk−1=(1−s)21です。幾何分布の期待値計算に使えます。
問題4:部分積分
この問題を含む「数学コラム 必要な数学の確認」の解説へ
∫0∞xe−xdxを部分積分で求めてください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
u=x,dv=e−xdx とすると、du=dx,v=−e−x なので、
∫0∞xe−xdx=[−xe−x]0∞+∫0∞e−xdx=0+1=1です。
問題5:1変数の変数変換
この問題を含む「数学コラム 必要な数学の確認」の解説へ
Y=eX とします。X の密度が fX(x) のとき、Y の密度を求めてください。
解答・解説を開く
最初の一歩まず変換後の値が動く範囲を決め、元の変数へ戻す式とヤコビアンを確認します。単調でない変換では、同じ値へ移る元の点をすべて数えます。
逆変換は x=logy、ヤコビアンは、
dydx=y1です。y>0 で、
fY(y)=fX(logy)y1です。
問題6:Leibnizの公式
この問題を含む「数学コラム 必要な数学の確認」の解説へ
H(t)=∫0t(x−t)2f(x)dxを t で微分してください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
上端の境界項は (t−t)2f(t)=0 です。被積分関数を偏微分すると、
∂t∂{(x−t)2f(x)}=−2(x−t)f(x)なので、
H′(t)=−2∫0t(x−t)f(x)dxです。
問題7:Hessian
この問題を含む「数学コラム 必要な数学の確認」の解説へ
f(x,y)=x2+2xy+3y2の勾配とHessian行列を求めてください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
∇f=(2x+2y2x+6y)Hf=(2226)です。
問題8:ヤコビアン
この問題を含む「数学コラム 必要な数学の確認」の解説へ
u=x+y,v=x−yの逆変換と ∣∂(x,y)/∂(u,v)∣ を求めてください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
連立して、
x=2u+v,y=2u−vです。したがって、
∂(u,v)∂(x,y)=1/21/21/2−1/2=−21=21です。
問題9:線形結合の分散
この問題を含む「数学コラム 必要な数学の確認」の解説へ
共分散行列が Σ の確率ベクトル X に対して、Y=aTX の分散を求めてください。
解答・解説を開く別解あり
最初の一歩求める量を定義式へ戻します。平均を先に求め、分散では E[X2]−E[X]2、共分散では積の期待値と平均の積を区別します。
Y−E[Y]=aT(X−E[X])なので、
Var(Y)=aTΣaです。
別解・別の見方分散を成分ごとに展開する代わりに、係数ベクトルと共分散行列を使って operatornameVar(aTX)=aTSigmaa と一行で表せます。
問題10:固有値
この問題を含む「数学コラム 必要な数学の確認」の解説へ
A=(2112)の固有値を求めてください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
∣A−λI∣=2−λ112−λ=(2−λ)2−1です。これを0とおくと、
(2−λ)2=1より、
λ=3,1です。両方正なので、A は正定値です。
問題11:ガンマ関数
この問題を含む「数学コラム 必要な数学の確認」の解説へ
Γ(5) を漸化式から求めてください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
Γ(5)=4Γ(4)=4⋅3Γ(3)=4⋅3⋅2Γ(2)=4!=24です。
問題12:制約付き最適化
この問題を含む「数学コラム 必要な数学の確認」の解説へ
x+y=1 の下で x2+y2 を最小にしてください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
L(x,y,λ)=x2+y2−λ(x+y−1)とおきます。
2x−λ=0,2y−λ=0より x=y です。制約へ代入して、
x=y=21です。最小値は、
(21)2+(21)2=21です。
数理統計問題(21問)
問題1:標本平均の標本分布
この問題を含む「第五章 標本分布とその近似」の解説へ
X1,…,X25 は平均12、分散9の母集団からの独立同一分布標本とします。
- E[Xˉ] と Var(Xˉ) を求めてください。
- 母集団が正規分布なら、P(11.4≤Xˉ≤12.6) を求めてください。
解答・解説を開く
最初の一歩求める量を定義式へ戻します。平均を先に求め、分散では E[X2]−E[X]2、共分散では積の期待値と平均の積を区別します。
期待値と分散は、
E[Xˉ]=12Var(Xˉ)=259=0.36です。したがって標準誤差は、
SE(Xˉ)=0.36=0.6です。正規母集団なら、
Xˉ∼N(12,0.36).よって、
P(11.4≤Xˉ≤12.6)=P(0.611.4−12≤Z≤0.612.6−12)=P(−1≤Z≤1)≈0.6827.問題2:不偏標本分散
この問題を含む「第五章 標本分布とその近似」の解説へ
X1,…,Xn は平均 μ、分散 σ2 の独立同一分布標本です。
Sn2=n1i=1∑n(Xi−Xˉ)2と置くとき、E[Sn2] を求めてください。
解答・解説を開く
最初の一歩求める量を定義式へ戻します。平均を先に求め、分散では E[X2]−E[X]2、共分散では積の期待値と平均の積を区別します。
偏差平方和の期待値は、
E[i=1∑n(Xi−Xˉ)2]=(n−1)σ2でした。したがって、
E[Sn2]=n1(n−1)σ2=nn−1σ2.n で割る標本分散は母分散を過小評価します。n−1 で割ることで不偏になります。
問題3:母分散の信頼区間
この問題を含む「第五章 標本分布とその近似」の解説へ
正規母集団からの大きさ10の標本で s2=4.0 を得ました。自由度9のカイ二乗分布について、
χ9,0.0252=2.700,χ9,0.9752=19.023とします。母分散 σ2 の95%信頼区間を求めてください。
解答・解説を開く
最初の一歩求める量を定義式へ戻します。平均を先に求め、分散では E[X2]−E[X]2、共分散では積の期待値と平均の積を区別します。
σ2(n−1)S2∼χn−12なので、
P(2.700≤σ29S2≤19.023)=0.95.正の量について不等号を解くと、
P(19.0239S2≤σ2≤2.7009S2)=0.95.s2=4.0 を代入して、
(19.02336,2.70036)≈(1.89,13.33).分散の区間は非対称になります。
問題4:t 統計量
この問題を含む「第五章 標本分布とその近似」の解説へ
正規母集団から大きさ16の標本を取り、xˉ=52、s=8 を得ました。H0:μ=48 を検定する1標本 t 統計量を求めてください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
t=s/nxˉ−μ0=8/1652−48=24=2.自由度は n−1=15 です。両側検定なら ∣t∣ を t15 の両側臨界値と比較します。
問題5:t と F の関係
この問題を含む「第五章 標本分布とその近似」の解説へ
T∼t12 とします。T2 の分布を導いてください。
解答・解説を開く別解あり
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
定義から、独立な Z∼N(0,1) と V∼χ122 を使って、
T=V/12Zと書けます。両辺を2乗すると、
T2=V/12Z2/1.Z2∼χ12 なので、F 分布の定義から、
T2∼F1,12.別解・別の見方T=Z/sqrtV/u を平方して定義から示す方法が最短です。密度を変数変換して導く方法もありますが、試験答案では定義を使う方が簡潔です。
問題6:Chebyshev上界
この問題を含む「第五章 標本分布とその近似」の解説へ
平均100、分散64の母集団から独立に64個を抽出します。P(∣Xˉ−100∣≥2) のChebyshev上界を求めてください。
解答・解説を開く別解あり
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
標本平均の分散は、
Var(Xˉ)=6464=1.したがって、
P(∣Xˉ−100∣≥2)≤221=0.25.これは分布形を使わない保証であり、実際の確率と一致するとは限りません。
別解・別の見方Chebyshevの不等式を暗記していなくても、非負変数 (X−mu)2 にMarkovの不等式を適用すれば導けます。
問題7:大数の弱法則
この問題を含む「第五章 標本分布とその近似」の解説へ
Xi∼iidBernoulli(p) とします。標本比率 p^n が p に確率収束することを示してください。
解答・解説を開く
最初の一歩元の統計量、中心化、尺度化、使う定理とその条件の順に整理します。近似では標本数や独立性などの条件も答案に添えます。
Bernoulli分布の平均と分散は、
E[Xi]=p,Var(Xi)=p(1−p).p^n=Xˉn なので、Chebyshevの不等式から、
P(∣p^n−p∣≥ε)≤nε2p(1−p)→0.よって、
p^npp.問題8:二項分布の正規近似
この問題を含む「第五章 標本分布とその近似」の解説へ
Y∼Bin(200,0.4) とします。P(Y≥90) を連続補正付き正規近似で表してください。
解答・解説を開く別解あり
最初の一歩元の統計量、中心化、尺度化、使う定理とその条件の順に整理します。近似では標本数や独立性などの条件も答案に添えます。
平均と分散は、
E[Y]=200(0.4)=80Var(Y)=200(0.4)(0.6)=48.Y≥90 には下側境界89.5を使うので、
P(Y≥90)≈P(Z≥4889.5−80)=P(Z≥1.371).標準正規分布表から約0.085です。
別解・別の見方二項変数をベルヌーイ変数の和と書いて中心極限定理を使う方法と、de Moivre—Laplaceの定理を直接使う方法があります。
問題9:Slutskyの定理
この問題を含む「第五章 標本分布とその近似」の解説へ
n(θ^n−θ)dN(0,τ2),τ^npτ>0とします。n(θ^n−θ)/τ^n の極限分布を求めてください。
解答・解説を開く
最初の一歩元の統計量、中心化、尺度化、使う定理とその条件の順に整理します。近似では標本数や独立性などの条件も答案に添えます。
まず、
τn(θ^n−θ)dN(0,1).また、連続写像定理から、
τ^nτp1.積に分けると、
τ^nn(θ^n−θ)=τn(θ^n−θ)τ^nτ.Slutskyの定理より、
τ^nn(θ^n−θ)dN(0,1).問題10:デルタ法によるオッズの分散
この問題を含む「第五章 標本分布とその近似」の解説へ
p^ が、
n(p^−p)dN(0,p(1−p))を満たすとします。推定オッズ p^/(1−p^) の漸近分散を求めてください。
解答・解説を開く
最初の一歩求める量を定義式へ戻します。平均を先に求め、分散では E[X2]−E[X]2、共分散では積の期待値と平均の積を区別します。
g(p)=1−ppと置くと、
g′(p)=(1−p)2(1−p)+p=(1−p)21.デルタ法から、
n{1−p^p^−1−pp}dN(0,(1−p)3p).したがって推定オッズ自体の近似分散は、
Var(1−p^p^)≈n(1−p)3p.問題11:分散安定化変換
この問題を含む「第五章 標本分布とその近似」の解説へ
Y∼Poisson(λ) とします。g(Y)=Y の近似分散をデルタ法で求めてください。
解答・解説を開く
最初の一歩求める量を定義式へ戻します。平均を先に求め、分散では E[X2]−E[X]2、共分散では積の期待値と平均の積を区別します。
g′(λ)=1/(2λ) なので、
Var(Y)≈{g′(λ)}2Var(Y)=4λ1λ=41.近似分散は λ に依存しません。
問題12:最大値の分布
この問題を含む「第五章 標本分布とその近似」の解説へ
X1,…,Xn∼iidExp(λ) とし、Mn=X(n) とします。
- Mn の分布関数を求めてください。
- P(Mn≤m)=0.95 となる m を求めてください。
解答・解説を開く別解あり
最初の一歩最大値が x 以下である事象を「すべての観測値が x 以下」と言い換え、まず分布関数を求めます。密度が必要なら最後に微分します。
指数分布の分布関数は、x≥0 で、
F(x)=1−e−λxです。したがって、
FMn(m)={1−e−λm}n.95%点は、
{1−e−λm}n=0.95を解きます。
1−e−λm=0.951/ne−λm=1−0.951/nより、
m=−λ1log{1−0.951/n}.別解・別の見方最大値の分布関数を積で求める代わりに、余事象「少なくとも1つが x を超える」を考えることもできます。独立性があると分布関数法の方が短くなります。
問題13:一様分布の順序統計量
この問題を含む「第五章 標本分布とその近似」の解説へ
U1,…,U9∼iidUnif(0,1) とします。標本中央値 U(5) の分布、平均、分散を求めてください。
解答・解説を開く
最初の一歩最大値が x 以下である事象を「すべての観測値が x 以下」と言い換え、まず分布関数を求めます。密度が必要なら最後に微分します。
一様分布の順序統計量より、
U(5)∼Beta(5,5).平均は、
E[U(5)]=5+55=21.分散は、
Var(U(5))=(5+5)2(5+5+1)5⋅5=110025=441.問題14:収束様式
この問題を含む「第五章 標本分布とその近似」の解説へ
U∼Unif(0,1) とし、Xn=U/n とします。Xn の概収束、確率収束、平均二乗収束を調べてください。
解答・解説を開く
最初の一歩元の統計量、中心化、尺度化、使う定理とその条件の順に整理します。近似では標本数や独立性などの条件も答案に添えます。
任意の標本点で 0≤U≤1 なので、
0≤Xn=nU≤n1→0.したがって、すべての標本点で Xn→0 であり、
Xna.s.0.また、
E[(Xn−0)2]=n2E[U2]=3n21→0なので、
XnL20.どちらからも確率収束が従い、
Xnp0.問題15:Lyapunov条件
この問題を含む「第五章 標本分布とその近似」の解説へ
各 n で独立な確率変数 Xn1,…,Xnn が、E[Xnj]=0、Var(Xnj)=1、さらに一様に、
E[∣Xnj∣3]≤Cを満たすとします。δ=1 のLyapunov条件を確認してください。
解答・解説を開く
最初の一歩元の統計量、中心化、尺度化、使う定理とその条件の順に整理します。近似では標本数や独立性などの条件も答案に添えます。
総分散は、
sn2=j=1∑n1=nなので、sn3=n3/2 です。したがって、
sn31j=1∑nE[∣Xnj∣3]≤n3/2nC=nC→0.よってLyapunov条件が成り立ち、
n1j=1∑nXnjdN(0,1).問題16:t 分布と F 分布の積率・存在条件
この問題を含む「第五章 標本分布とその近似」の解説へ
独立な確率変数
Z∼N(0,1),V∼χν2から、
T=V/νZを定義します。
- T の平均と分散、およびそれらが存在する自由度の条件を求めてください。
- 独立な U∼χm2、V∼χn2 に対し、F=(U/m)/(V/n) とします。E[Fr] と、その存在条件を求めてください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
T は自由度 ν の t 分布に従います。分布は0について対称なので、絶対可積分である ν>1 のとき、
E[T]=0です。ν≤1 では平均は存在しません。
ν>2 のとき、独立性より、
E[T2]=E[Z2]νE[V−1]=1×ν×ν−21=ν−2ν.平均が0なので、
Var(T)=ν−2ν(ν>2)です。1<ν≤2 では平均は存在しますが、分散は存在しません。
次に、
Fr=(mn)rUrV−rです。独立性とカイ二乗分布の積率公式から、
E[Ur]=2rΓ(m/2)Γ(m/2+r),E[V−r]=2−rΓ(n/2)Γ(n/2−r).よって、
E[Fr]=(mn)rΓ(m/2)Γ(n/2)Γ(m/2+r)Γ(n/2−r)です。存在条件は、
−2m<r<2nです。特に r=1 とすれば、n>2 のとき、
E[F]=n−2nを得ます。
答案で気をつけること平均・分散の値だけでなく、存在する自由度の範囲を書きます。対称性だけでは平均0とはいえず、絶対可積分性が必要です。F 分布の高次積率の存在条件は分母側の自由度 n が支配します。
問題17:標本分散の漸近正規性
この問題を含む「第五章 標本分布とその近似」の解説へ
X1,…,Xn は平均 μ、分散 σ2 の母集団からのi.i.d.標本で、
μ4=E[(X1−μ)4]<∞とします。不偏標本分散
Sn2=n−11i=1∑n(Xi−Xˉn)2に対して、
n(Sn2−σ2)dN(0,μ4−σ4)を示してください。
解答・解説を開く
最初の一歩求める量を定義式へ戻します。平均を先に求め、分散では E[X2]−E[X]2、共分散では積の期待値と平均の積を区別します。
恒等式
i=1∑n(Xi−Xˉn)2=i=1∑n(Xi−μ)2−n(Xˉn−μ)2より、
Sn2=n−1n{n1i=1∑n(Xi−μ)2−(Xˉn−μ)2}.Yi=(Xi−μ)2 とおくと、
E[Yi]=σ2,Var(Yi)=μ4−σ4.中心極限定理より、
n(n1i=1∑nYi−σ2)dN(0,μ4−σ4).一方、Xˉn−μ=Op(n−1/2) なので、
n(Xˉn−μ)2=Op(n−1/2)p0.また、n/(n−1)→1 であり、不偏化による差 nσ2/(n−1) も0へ収束します。したがってSlutskyの定理より、
n(Sn2−σ2)dN(0,μ4−σ4).正規母集団では μ4=3σ4 なので、極限分散は 2σ4 です。
答案で気をつけること標本分散をそのまま扱わず、真の平均まわりの2次モーメントと標本平均の補正に分解します。Op の項を消すときは、Xˉn−μ=Op(n−1/2) から二乗の次数を明記します。
問題18:デルタ法と境界事象の処理
この問題を含む「第五章 標本分布とその近似」の解説へ
Kn∼Bin(n,p)、0<p<1 とし、p^n=Kn/n とします。Kn≥1 のとき Yn=logp^n、Kn=0 のとき Yn=0 と定義します。次を示してください。
Ynplogpn(Yn−logp)dN(0,p1−p)解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
大数の法則より、
p^npp.p>0 で g(x)=logx は連続なので、連続写像定理から、通常は logp^nplogp といえます。ここでは p^n=0 で対数が定義できませんが、
P(Kn=0)=(1−p)n→0です。したがって、0回成功のときだけ別の値を割り当てても確率極限は変わりません。
二項分布の中心極限定理より、
n(p^n−p)dN(0,p(1−p)).g′(p)=1/p なので、デルタ法により、
n{g(p^n)−g(p)}dN(0,{g′(p)}2p(1−p))=N(0,p1−p).Kn=0 の事象の確率は0へ収束するため、同じ極限が Yn にも成り立ちます。
答案で気をつけること対数変換では0が定義域外になる問題を無視しません。「その事象の確率が0へ行くため、任意の値で補っても極限分布は変わらない」と説明します。デルタ法では導関数と元の極限分散を別々に書くと計算ミスを防げます。
問題19:指数分布の最大値とGumbel分布
この問題を含む「第五章 標本分布とその近似」の解説へ
X1,…,Xn は率 λ の指数分布に従うi.i.d.確率変数とし、
Mn=max(X1,…,Xn)とします。次を示してください。
λMn−logndG,ただし G の分布関数は、
P(G≤x)=exp(−e−x)です。
解答・解説を開く
最初の一歩最大値が x 以下である事象を「すべての観測値が x 以下」と言い換え、まず分布関数を求めます。密度が必要なら最後に微分します。
固定した実数 x に対し、十分大きな n では (logn+x)/λ>0 です。独立性より、
P(λMn−logn≤x)=P(Mn≤λlogn+x)=i=1∏nP(Xi≤λlogn+x)={1−exp[−(logn+x)]}n=(1−ne−x)n.n→∞ とすると、(1−a/n)n→e−a より、
P(λMn−logn≤x)→exp(−e−x).よってGumbel分布への分布収束が示されました。
答案で気をつけること最大値の分布は P(Mn≤x)=F(x)n から始めます。正規化は「中心化 logn」と「尺度 1/λ」の両方が必要です。極限分布のCDFが0から1へ増加する向きも確認します。
問題20:重み付き平均の大数の法則
この問題を含む「第五章 標本分布とその近似」の解説へ
X1,X2,… は平均 μ、分散 σ2<∞ のi.i.d.確率変数とします。
Tn=n(n+1)2j=1∑njXjに対して、Tnpμ を示してください。
解答・解説を開く
最初の一歩求める量を定義式へ戻します。平均を先に求め、分散では E[X2]−E[X]2、共分散では積の期待値と平均の積を区別します。
重みの総和は、
n(n+1)2j=1∑nj=1なので、
E[Tn]=μです。独立性より、
Var(Tn)=n2(n+1)24σ2j=1∑nj2=n2(n+1)24σ26n(n+1)(2n+1)=3n(n+1)2σ2(2n+1)→0.したがって、任意の ε>0 に対してChebyshevの不等式から、
P(∣Tn−μ∣≥ε)≤ε2Var(Tn)→0.よって Tnpμ です。
答案で気をつけること重み付き平均では、重みの総和が1か、最大の重みが0へ行くかを確認します。独立性がない場合は分散に共分散項が加わるため、この計算をそのまま使えません。
発展問題21:Chernoff境界をポアソン分布で最適化する
この問題を含む「第五章 標本分布とその近似」の解説へ
積率母関数 MX(t)=E[etX] が存在するとき、t>0 に対して、
P(X≥a)≤e−taMX(t)を示してください。さらに、X∼Poisson(λ)、a>λ のとき、右辺を t について最小化してください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
t>0 なら x↦etx は単調増加なので、
{X≥a}={etX≥eta}.非負確率変数 etX にMarkovの不等式を適用すると、
P(X≥a)≤etaE[etX]=e−taMX(t).ポアソン分布の積率母関数は、
MX(t)=exp{λ(et−1)}なので、上界の対数は、
q(t)=−ta+λ(et−1)です。微分すると、
q′(t)=−a+λet,q′′(t)=λet>0.a>λ より、最小点は正の値
t∗=logλaです。これを代入して、
P(X≥a)≤exp{−alogλa+a−λ}を得ます。
答案で気をつけること上側確率では t>0、下側確率では通常 t<0 を使います。最適化では対数を取ってから微分し、停留点が許された範囲に入ることと2階微分が正であることを確認します。
医薬・生命科学の問題(9問)
問題1:独立単位と標準誤差
この問題を含む「第五章 標本分布とその近似」の解説へ
対照群6匹、処置群6匹のマウスから、それぞれ1匹当たり200細胞を測定しました。細胞レベルの測定値を使って処置効果を比較したいとします。
- 処置効果の独立な標本数を各群1200と考えてよいですか。
- どのような解析単位またはモデルが候補ですか。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
各群1200とは考えられません。処置はマウスに割り付けられ、同じマウス内の細胞は共通の生物学的背景、処置、調製、測定バッチを共有するため依存します。
目的に応じて、次が候補です。
- マウスごとに細胞測定を要約し、各群 n=6 として比較する
- 細胞をレベル1、マウスをレベル2とする階層モデルを使う
- 遺伝子発現なら、個体単位のpseudobulkを作る
細胞数を増やすと各マウス内の要約精度は上がりますが、個体間変動を推定する独立単位は増えません。
問題2:小標本の薬効指標
この問題を含む「第五章 標本分布とその近似」の解説へ
独立な10例で、投与前後差の平均が −4.0、標本標準偏差が5.0でした。差が正規分布に従うと仮定し、母平均差の95%信頼区間を求めてください。t9,0.975=2.262 とします。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
対応差を1標本として扱います。標準誤差は、
ns=105≈1.581.したがって、
dˉ±t9,0.975ns=−4.0±2.262(1.581)=−4.0±3.576.95%信頼区間は、
(−7.58,−0.42)です。0を含まないことは統計的な差を示しますが、臨床的意義は効果量、評価尺度、事前に定めた重要差と合わせて判断します。
問題3:2つの測定法の精度
この問題を含む「第五章 標本分布とその近似」の解説へ
同じ濃度水準で、測定法Aを11回、測定法Bを9回独立に測定し、標本分散がそれぞれ sA2=1.8、sB2=0.9 でした。正規性と独立性を仮定します。
- 分散比統計量を求めてください。
- 帰無仮説のもとでの分布を書いてください。
- 実務上の注意を述べてください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
分散比は、
F=sB2sA2=0.91.8=2.0.H0:σA2=σB2 のもとで、
F∼F10,8.ただし、測定日の違い、試料調製、装置バッチ、濃度依存の不均一分散、外れ値を確認します。同一試料を両測定法で測ったなら結果は対応しており、独立2標本の単純な分散比だけでは設計を十分に表せません。
問題4:有害事象割合とデルタ法
この問題を含む「第五章 標本分布とその近似」の解説へ
独立な400例中、80例で有害事象が観測されました。
- 標本比率とその近似標準誤差を求めてください。
- g(p)=log{p/(1−p)} の近似標準誤差を求めてください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
標本比率は、
p^=40080=0.20.近似標準誤差は、
SE(p^)=4000.2(0.8)=0.02.ロジット関数の微分は、
g′(p)=p1+1−p1=p(1−p)1.したがって、
SE{g(p^)}≈p^(1−p^)1SE(p^)=0.2(0.8)0.02=0.125.比率が0または1に近い場合、単純な正規近似やロジット変換は不安定になるため、二項尤度に基づく方法を検討します。
問題5:コロニー数と平方根変換
この問題を含む「第五章 標本分布とその近似」の解説へ
ある培養条件で、1視野当たりのコロニー数を Y∼Poisson(25) と近似します。
- Y の標準偏差を求めてください。
- Y の近似標準偏差を求めてください。
- データ解析でPoisson仮定以外に確認すべきことを挙げてください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
Poisson分布では分散が平均に等しいため、
SD(Y)=25=5.平方根変換後の近似分散は 1/4 なので、
SD(Y)≈21.解析では、過分散、ゼロ過剰、視野面積の違い、同一培養皿内の視野間相関、検出限界を確認します。過分散があるなら負の二項分布、階層構造があるならランダム効果を含む計数モデルが候補です。
問題6:最大QT延長の解釈
この問題を含む「第五章 標本分布とその近似」の解説へ
同じ分布から独立に得られるQT延長量を考えます。試験Aは各患者1時点、試験Bは各患者20時点で測定し、各患者の最大値を報告しました。試験Bの最大値が大きい傾向を示しました。
この結果だけから試験Bの薬剤が危険だと結論できますか。
解答・解説を開く
最初の一歩最大値が x 以下である事象を「すべての観測値が x 以下」と言い換え、まず分布関数を求めます。密度が必要なら最後に微分します。
結論できません。Mn の分布関数は、
P(Mn≤x)=F(x)nなので、同じ母分布でも観測回数 n が多いほど最大値は大きくなりやすいからです。
少なくとも、測定時点数、時間窓、ベースライン補正、同一患者内相関、欠測、心拍補正法、併用薬をそろえて比較します。最大値だけでなく、事前指定時点、時間平均、閾値超過、濃度QTモデルなどを検討します。
問題7:多施設データとLindeberg条件
この問題を含む「第五章 標本分布とその近似」の解説へ
多数の独立患者について治療効果の和を考えます。患者ごとに分散が異なりますが、各患者の寄与は有界で、総分散は患者数とともに増加するとします。
- iid中心極限定理をそのまま引用してよいですか。
- Lindeberg条件を薬学的に説明してください。
解答・解説を開く
最初の一歩元の統計量、中心化、尺度化、使う定理とその条件の順に整理します。近似では標本数や独立性などの条件も答案に添えます。
同一分布ではないため、iid中心極限定理をそのまま引用するのは不十分です。独立非同一分布のLindeberg–Feller定理などの条件を確認します。
薬学的には、特定の1患者の極端な反応や極端に大きな分散が、研究全体のばらつきを支配しないことを要求します。有界な寄与と増大する総分散はLindeberg条件を満たしやすくします。
ただし、施設内相関がある場合は患者間独立性が崩れるため、施設をクラスターとして扱う必要があります。
問題8:上位分位点のバイオマーカー
この問題を含む「第五章 標本分布とその近似」の解説へ
バイオマーカー分布の95%分位点を正常上限として推定したいとします。標本中央値より大きな標本数が必要になりやすい理由を、順序統計量と漸近分散から説明してください。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
95%分位点は並べた標本の上端近くにあり、それより大きい観測は全体の約5%しかありません。したがって、実質的に利用できる裾の情報が少なくなります。
漸近分散は、
Var(ξ^p)≈nf(ξp)2p(1−p)です。上側裾では密度 f(ξ0.95) が小さいことが多く、分母が小さくなるため分散が大きくなります。
正常上限を設定するには、対象集団の定義、年齢・性別などの層別、測定誤差、外れ値、必要な信頼度を踏まえて標本数を設計します。
問題9:薬物動態量の比
この問題を含む「第五章 標本分布とその近似」の解説へ
同じ被験者で測定したAUCと Cmax の推定量を θ^1,θ^2 とし、その比 R=θ1/θ2 の標準誤差をデルタ法で求めたいとします。共分散を無視してよいでしょうか。
解答・解説を開く
最初の一歩問題文から「与えられた量」「求める量」「使えそうな定義や定理」を1つずつ抜き出し、式へ置き換えてから計算します。
同じ被験者から得たAUCと Cmax は通常相関するため、共分散を無視すべきではありません。勾配、
∇g=(1/θ2−θ1/θ22)と共分散行列 Σ を用いて、
Var(R^)≈n1∇g⊤Σ∇gと評価します。共分散項の符号によって、独立と仮定した計算より分散が大きくも小さくもなります。