🧬 biology

In Search of Manifolds Inside Protein Language Models: A Largely Negative Report

Diese Arbeit untersucht systematisch die Manifold-Hypothese in Protein-Sprachmodellen (pLMs) unter Verwendung einer umfassenden Batterie geometrischer und topologischer Diagnostika und kommt zu dem Schluss, dass die Repräsentationen von pLMs im Gegensatz zu Single-Cell-Foundation-Modellen vorwiegend hochdimensional und linear anstatt um niederdimensionale Mannigfaltigkeiten organisiert sind.

Olivia Denvis2026-07-22
🧬 biology

Geometric Representations of Knowledge Inside Biological Large Language Models: an Empirical Analysis

Diese empirische Studie zeigt auf, dass biologische große Sprachmodelle (SCFMs) zwar eine reale, niedrigdimensionale und teilweise linearisierte geometrische Struktur für biologisches Wissen kodieren, diese Struktur jedoch bescheiden, oft nichtlinear verschränkt und weitgehend deckungsgleich mit dem ist, was klassische, auf der Genexpression basierende Methoden wie die PCA bereits erfassen können, wodurch sie hinter der klaren, regelmäßigen Geometrie zurückbleibt, die in Modellen der natürlichen Sprache beobachtet wird.

Olivia Denvis2026-07-22
🧬 biology

An Empirical Comparison of Virtual Cell Models: Perturbation Prediction, Representation, and the Baseline Gap

Diese Arbeit präsentiert einen vereinheitlichten Benchmark von elf virtuellen Zellmodellen und zeigt auf, dass Deep-Learning-Ansätze zwar bei Repräsentationsaufgaben und der Vorhersage kombinatorischer Perturbationen herkömmliche Baselines signifikant übertreffen, sie jedoch im Allgemeinen daran scheitern, einfache lineare Modelle bei der Vorhersage ungesehener Einzelgen-Perturbationen zu übertreffen, was darauf hindeutet, dass das Feld eher ein „virtuelles Mikroskop“ für die Analyse von Zellzuständen als einen echten „virtuellen Simulator“ für kausale Perturbationsdynamiken erreicht hat.

Olivia Denvis2026-07-22
🧬 biology

Findings from Sparse Autoencoders for DNA Sequence Models: Motif Detectors, Reading-Frame Features, and the Scarcity of Regulatory Logic

Diese Studie zeigt auf, dass Sparse Autoencoder zwar effektiv monosemantische, biologisch interpretierbare Merkmale wie Sequenzmotive und Leserahmen aus DNA-Fundamentmodellen extrahieren, sie jedoch auch einen signifikanten Mangel an Merkmalen offenbaren, die komplexe regulatorische Logik kodieren, was darauf hindeutet, dass aktuelle Modelle eher ein genomisches Wörterbuch als eine Grammatik-Engine erfassen.

Olivia Denvis2026-07-22
🧬 biology

Information Entropy of Biological Data: An Empirical Analysis

Diese Arbeit präsentiert eine einheitliche empirische Analyse über sechs biologische Datentypen hinweg, die zeigt, dass der Bias bei endlichen Stichproben informationstheoretische Schätzungen massiv verzerrt, und argumentiert, dass das Berichten von Entropie und Transinformation ohne Angabe des Schätzers und der Stichprobengröße unvertretbar ist, da bias-korrigierte Methoden distinkte biologische Signale offenbaren und eine systematische Unterschätzung der Entropie sowie eine Überschätzung des Informationsgehalts korrigieren.

Alexander Memming2026-07-22
🧬 biology

Pre-Transformer Models for Longevity Science and Deep Ageing Clocks: An Empirical Analysis

Diese empirische Studie zeigt, dass Pre-Transformer-Modelle (wie etwa die penalisierte Regression und Gradient Boosting) bei der Vorhersage des biologischen Alters über verschiedene Alterkohorten hinweg in Bezug auf Genauigkeit, Dateneffizienz, Kohortenübergreifende Transferleistung und Mortalitätsrisiko-Stratifizierung im Allgemeinen Transformer-basierte Attention-Modelle übertreffen oder mit ihnen gleichziehen, wodurch sie sich als rationale Standardlösung für die Langlebigkeitsforschung etablieren und Transformer als ein spezialisiertes Werkzeug positionieren, das nur bei außergewöhnlich großen Datensätzen praktikabel ist.

John Feng2026-07-22
🧬 biology

Deep Learning for Longevity Biomarker Development: An Empirical Analysis of Model Capacity versus Prediction Target for Blood-Based Aging Clocks

Diese empirische Studie zeigt, dass bei blutbasierten Altersuhren die Wahl des Vorhersageziels (sterblichkeitsbasierte phänotypische Alter gegenüber chronologischem Alter) die Validität der Biomarker und die Assoziation mit der Mortalität überwältigend bestimmt, wodurch eine Erhöhung der Kapazität von Deep-Learning-Modellen für die Verbesserung dieser kritischen Ergebnisse weitgehend unwirksam wird.

John Feng2026-07-22
🧬 biology

Alzheimer's Disease as the Result of Aberrant Reactivation of Embryonic Brain Pathways Silenced Decades Earlier

Diese Studie schlägt vor, dass die Alzheimer-Krankheit aus der aberranten epigenetischen Reaktivierung verstummter embryonaler Aktin-Myosin-Oszillationspfade in alternden Neuronen und Gliazellen resultiert, was eine mechanische Instabilität erzeugt, die eher einen axonalen „Dying-Back“-Prozess und synaptischen Rückzug vorantreibt als eine bloße passive Proteotoxizität.

Steven Lehrer2026-07-22
🧬 biology

EMT activates ER-to-Golgi trafficking through upregulation of REEP2 to promote lung cancer progression

Diese Studie identifiziert REEP2 als einen entscheidenden Mediator der durch EMT getriebenen Lungenkrebsprogression und zeigt auf, dass die ZEB1/miR-183/193a-Achse REEP2 hochreguliert, um den ER-zu-Golgi-Transport sowie die Sekretion protumorogener Faktoren zu verstärken und dadurch die Tumormetastasierung und Immunsuppression zu fördern.

Guan-Yu Xiao, Kevin Fulp, Oluwafunminiyi Obaleye, Shike Wang, Xin Liu, Jiang Yu, Jonathan M. Kurie, Jun Xu, William Russ (…)2026-07-22