← 最新の論文
📊 statistics

Do not log(x+1) transform: the bias and alternatives

本論文は、広く用いられているlog(x + 1)変換は、特に指数分布に従うデータに対して重大なバイアスと誤解を招く推論をもたらすと論じ、その代わりに一般化線形モデル(GLM)のような代替的な数値的手法を採用することを推奨するものである。

原著者: Vasco Vieira, Cátia Bartilotti, Jorge Lobo-Arteaga, Rafael Santos, David Leitão-Silva, Arthur Veronez, Joana Neves, Ana Brito, Rui Cereja, Diogo Paulo, Francisco Leitão

公開日 2026-08-20
📖 1 分で読めます☕ さくっと読める

原著者: Vasco Vieira, Cátia Bartilotti, Jorge Lobo-Arteaga, Rafael Santos, David Leitão-Silva, Arthur Veronez, Joana Neves, Ana Brito, Rui Cereja, Diogo Paulo, Francisco Leitão

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

自然界において、測定値は単純な直線に従わないことがよくあります。科学者が池の魚の数を数えたり、森林の樹冠の高さを測ったり、海洋の温度を追跡したりするとき、データが均等に広がることは滅多にありません。代わりに、小さな値は頻繁に現れ、大きな値は稀であるという、偏った形状を作り出します。これにより、標準的な数学的ツールではパターンを見出すことが困難になります。これを解決するために、研究者たちは長年、「対数変換」と呼ばれる数学的なトリックに頼ってきました。このプロセスは、巨大な数値を圧縮し、極小の数値を引き伸ばすことでデータを再形成し、ギザギザで不均一な風景を、関係性が明確で研究しやすい滑らかで平坦な平原へと変えるものです。しかし、このトリックはデータにゼロが含まれている場合に、高い壁に突き当たります。数学的操作がゼロを扱えないため、研究者たちは伝統的に、トリックを適用する前にすべての測定値に対して、ある小さな任意の数値を加算してきました。数十年にわたり、最も一般的な選択肢は、単にすべての値に1を加えるというもので、これは「log(x+1)」変換として知られています。それは、貴重な情報を捨て去ることなく、ゼロのカウントを研究に含めることを可能にする、無害で実用的な回避策であると思われてきました。

ポルトガルとアルガルヴェ大学の研究チームは、この長年の習慣が根本的に欠陥があることを示しました。コンピューターで生成された数値と現実世界の生態学的データの両方を用いてこの手法をテストすることで、データに定数を加えることは、単にゼロの問題を解決するだけでなく、真実を積極的に歪めてしまうことを彼らは証明しました。研究によれば、この単純な加算は重大なバイアスをもたらし、変数間の関係を歪め、科学者が自然界の仕組みについて誤った結論を導き出す原因となることが明らかになりました。研究者たちは、この歪みが単なる小さな不具合ではなく、関係性の傾きを変え、データの真の広がりを隠し、さらには傾向の方向さえ逆転させてしまう深刻なエラーであることを発見しました。彼らの研究は、科学界が直ちにこの特定の修正方法の使用を止め、任意の数に依存しない、より堅牢な手法を探すべきであることを示唆しています。

自説を証明するために、研究者たちはまず、2つの変数間の関係が正確に判明している、完璧な人工データセットを作成しました。彼らは、一つの変数がもう一つの変数に基づいて指数関数的に成長するという、自然界でよく見られるパターンを設計しましたが、現実世界の条件を模倣するために、いくつかのゼロの値を含めました。この完璧なデータに標準的なlog(x+1)変換を適用したところ、得られたモデルは著しく不正確でした。滑らかで予測可能であるはずの曲線は、折れ曲がり、壊れてしまいました。研究者たちは、数字の「1」の選択が元凶であることを見出しました。1は自然界で見られる極小の値と比較して大きな数字であるため、それを加えることで実際のデータを完全に圧倒してしまうのです。非常に小さな測定値に対しては、加えられた「1」が支配的な要因となり、それらの間の微細な差異を消失させてしまいます。より大きな測定値に対しては、加算が異なる影響を与え、数学モデルが修正できない不一致を生み出しました。研究者が「1」の代わりに非常に小さな数を使用しようとしても、問題は解消されませんでした。もし選んだ数が小さすぎれば、データ内のゼロが他のデータから遠く離れた値へと変換され、分析を軌道から外してしまう新たな種類の歪みを生み出したのです。

チームは次に、人工的な数値を超えて、海草の花成(かせい)やポルトガルの河口域における水質に関するものを含む、実際の生態学的研究を調査しました。海草の研究では、研究者たちは上昇する海水温がどのように大規模な花の開花を引き起こすのかを理解しようとしていました。熱と開花の関係は明らかに非線形であり、熱が増すにつれて加速的に増加していました。元の研究者がこの現象を分析するためにlog(x+1)法を用いたとき、得られた曲線は反応の真の強度を捉えることに失敗しました。それはピークを平坦化し、急速な加速を見逃してしまいました。対照的に、新しいチームが、定数を加えない異なる手法を用いて同じデータを再分析したとき、熱と開花の間にある真の鋭い関係性が明確に浮かび上がりました。同様に、河口域の研究では、科学者たちは海草の健康状態を判断するために、地上部と地下部のバイオマスの比率を調べていました。植物の中には成長しているものもいれば、縮小しているものもいたため、データには1を超える値と1を下回る値の両方が含まれていました。log(x+1)法はこれらの値を不均等に扱い、健全に成長している植物を圧縮し、衰退している植物を誇張したため、生態系の健康状態に対する歪んだ見解を導き出しました。研究者たちは、この歪みが単なる統計的な好奇心の対象ではなく、海草が繁栄しているのか、あるいは死にかけているのかという解釈を変えてしまうものであることを示しました。

研究チームはまた、他の一般的な数学的トリックが問題を解決できるかどうかについてもテストを行いました。彼らは、不均一なデータを滑らかにするためにしばしば使用される平方根や立方根、その他の複雑な調整を試みました。これらの代替案のいくつかは、特定の状況下ではlog(x+1)法よりも優れた結果を示しましたが、データにゼロが含まれ、かつ指数関数的なパターンに従う場合、問題を完全に解決できるものは一つもありませんでした。研究者たちは、データが指数関数的な挙動を示すとき、単純な公式で数値を整形しようとしても、エラーを導入することなしに標準的な線形モデルに適合させることはできないことを発見しました。しかし、彼らは、すべての変換が失敗する運命にあるわけではないことも明確にしています。指数関数的なモデルに厳密に従わないデータセットであれば、Box-Cox変換のような他の手法が成功する場合もあります。これらの特定の指数関数的なケースにおいては、論文は、データを無理に直線に当てはめないことこそが最善の解決策であると結論付けています。その代わりに、科学者は、任意の数値を加える必要なく、ゼロや指数関数的な成長を直接扱うことができる、非線形データ専用の統計モデル(一般化線形モデルなど)を使用すべきです。

この発見の持つ意味は、種がその場所に存在しない、あるいは汚染物質が検出不可能であるといった理由で、データにゼロが含まれることが多い環境科学において極めて重要です。長年、log(x+1)変換は、生物多様性、気候変動、汚染に関する数え切れないほどの研究で使用されてきた、ゼロを扱うためのデフォルトのツールでした。研究者たちは、この広範な使用が、関係性の強さが過小または過大に評価されたり、傾向の方向が誤解されたりといった、バイアスの生じた結果を生み出す多くの研究を招いてきた可能性が高いと主張しています。このバイアスは微妙なものではなく、研究の結果を変えてしまうほど大きなものです。著者たちは、log(x+1)法は使いやすいものの、科学的に妥当な解決策ではないと強調しています。彼らは、科学界がこの慣行を放棄し、データの真の性質を尊重する、より厳格な手法を採用することを強く求めています。そうすることで、研究者は、自分たちの結論が、便利ではあるが欠陥のあるショートカットによる数学的な産物ではなく、現実に基づいたものであることを保証できるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →