La bioinformatica è l'incontro vitale tra biologia e informatica, un campo che trasforma i dati biologici complessi in conoscenza comprensibile. Qui esploriamo come algoritmi e software aiutino gli scienziati a decifrare il codice della vita, dall'analisi del DNA alla scoperta di nuovi farmaci, rendendo accessibili scoperte che altrimenti rimarrebbero confinate in database tecnici.

Su Gist.Science, monitoriamo ogni nuovo preprint inviato da bioRxiv in questa categoria. Per ogni articolo, offriamo una doppia prospettiva: una spiegazione semplice per chiunque sia curioso e un riassunto tecnico dettagliato per i ricercatori. Questo approccio garantisce che le ultime novità scientifiche siano chiare, accurate e immediatamente disponibili.

Di seguito trovate i documenti più recenti pubblicati da bioRxiv nel settore della bioinformatica, pronti per essere esplorati nelle vostre forme più accessibili.

💻 bioinformatics

Predicting optimal growth temperatures of bacteria using learned structural information from a single protein

Il documento introduce ROSEATE, un nuovo framework che predice accuratamente le temperature ottimali di crescita batterica sfruttando le firme strutturali derivate da MSA Transformer di una singola proteina ubiquitaria, l'adenilato chinasi, consentendo un'inferenza termica robusta, filogeneticamente generalizzabile e a livello di comunità attraverso diversi ambienti.

Hoffert, M., Myerscough, D., Dragone, N. B., Gebert, M. J., Silberg, J. J., Fierer, N.2026-06-18
💻 bioinformatics

MetaHarmonizer: robust biomedical metadata harmonization and a contamination control for inflated LLM performance on public benchmarks

MetaHarmonizer è un sistema robusto, completamente locale e deterministico per l'armonizzazione automatizzata dei metadati biomedici che combina una cascata multistadio con vocabolari controllati per prevenire allucinazioni e prestazioni di benchmark gonfiate, raggiungendo un'accuratezza allo stato dell'arte nella mappatura di schemi e ontologie pur consentendo un triage basato su un principio di "human-in-the-loop".

Li, C., Dahl, A., Gravel-Pucillo, K. D., Long, K., Waters, M., de Bruijin, I., Davis, S., Oh, S.2026-06-17
💻 bioinformatics

VLab4Mic: prediction of structural resolvability in super-resolution microscopy

VLab4Mic è una piattaforma di simulazione che predice la risolvibilità strutturale degli assemblaggi proteici attraverso varie modalità di microscopia a super-risoluzione modellando il posizionamento delle sonde e i vincoli sterici, consentendo così ai ricercatori di valutare la fattibilità sperimentale prima di condurre esperimenti fisici.

Martinez, D., Saraiva, B. M., Shakespeare, T., Bates, M., Owen, D. M., Leterrier, C., Del Rosario, M., Henriques, R.2026-06-16
💻 bioinformatics

THEOBROMA: an aggregated open database of 1.13 million natural products with per-compound license auditing, three-tier classification, and stereochemistry-aware deduplication

THEOBROMA è un database aperto che aggrega oltre 1,13 milioni di prodotti naturali provenienti da 29 fonti e che si distingue attraverso l'audit delle licenze per singolo composto, un sistema di classificazione a tre livelli e la deduplicazione consapevole della stereochimica per consentire lo screening virtuale conforme alle licenze e l'analisi dell'attività biologica specifica per gli isomeri.

Klamt, T., Jaczkowski, A., Franke, J., Nejdl, W.2026-06-16
💻 bioinformatics

Rapid and consistent clustering of millions of genomes highlights the diversity of prokaryotic life

Gli autori presentano gemsparcl, uno strumento altamente scalabile ed efficiente che raggruppa oltre 5,6 milioni di genomi batterici in 92.954 unità genomiche coesive a livello di specie in circa 14 ore, superando così i colli di bottiglia computazionali per consentire un'analisi completa e priva di riferimenti della diversità e della tassonomia procariotica.

von Wachsmann, J. H., Lorenz, L. J., Gurbich, T. A., Russell, M. J., Rodriguez Bouza, V., Horsfield, S. T., Lees, J. A. (…)2026-06-15
💻 bioinformatics

WitChi: Efficient Detection and Pruning of Compositional Bias in Phylogenomic Alignments Using Empirical Chi-Squared Testing

WitChi è uno strumento computazionalmente efficiente che utilizza il test del chi-quadrato empirico per rilevare e rimuovere iterativamente i siti composizionalmente distorti da allineamenti filogenomici su larga scala, ripristinando così topologie filogenetiche accurate senza l'elevato costo computazionale di modelli complessi sensibili alla composizione.

Koestlbacher, S., Panagiotou, K., Tamarit, D., Ettema, T.2026-06-13
💻 bioinformatics

Testing the reliability of AI-generated protein structures

Questo studio dimostra che AlphaFold2 e ColabFold presentano un tasso di falsi positivi molto basso quando predicono strutture per sequenze non proteiche, rivelando serendipitamente che alcune predizioni ad alto punteggio in regioni genomiche umane non codificanti corrispondono a pseudogeni precedentemente non annotati, suggerendo potenziali errori nelle annotazioni geniche esistenti e convalidando l'utilità delle predizioni strutturali ad alto punteggio per ulteriori indagini.

Xu, A., Salzberg, S.2026-06-13
💻 bioinformatics

ADMETron: An AI-driven SaaS platform for comprehensive ADMET prediction and compound prioritisation

ADMETron è una piattaforma SaaS basata sull'intelligenza artificiale che integra embedding molecolari derivati da RNN con gradient boosting machines per predire 34 endpoint ADMET e presenta uno strumento di visualizzazione tramite grafico radar interattivo, consentendo una prioritizzazione dei composti ad alto rendimento e un processo decisionale basato sui dati nella scoperta di farmaci.

Nair, D. N., Yadav, R. S., Jondhale, P. M., Didhate, S., Gunjal, G., Ranjit, A., Patil, P., Dawande, A., Shisode, A., Bh (…)2026-06-13