La bioinformatica è l'incontro vitale tra biologia e informatica, un campo che trasforma i dati biologici complessi in conoscenza comprensibile. Qui esploriamo come algoritmi e software aiutino gli scienziati a decifrare il codice della vita, dall'analisi del DNA alla scoperta di nuovi farmaci, rendendo accessibili scoperte che altrimenti rimarrebbero confinate in database tecnici.

Su Gist.Science, monitoriamo ogni nuovo preprint inviato da bioRxiv in questa categoria. Per ogni articolo, offriamo una doppia prospettiva: una spiegazione semplice per chiunque sia curioso e un riassunto tecnico dettagliato per i ricercatori. Questo approccio garantisce che le ultime novità scientifiche siano chiare, accurate e immediatamente disponibili.

Di seguito trovate i documenti più recenti pubblicati da bioRxiv nel settore della bioinformatica, pronti per essere esplorati nelle vostre forme più accessibili.

💻 bioinformatics

amR: an R package suite to predict antimicrobial resistance in bacterial pathogens

La suite di pacchetti amR offre un framework completo e interpretabile per predire la resistenza antimicrobica nei patogeni batterici integrando l'estrazione di caratteristiche genomiche multi-scala, l'addestramento di modelli di apprendimento automatico e la visualizzazione interattiva per svelare i meccanismi di resistenza multi-farmaco e cross-specie.

Ghosh, A., Brenner, E. P., Boyer, E. A., McKim, A. P., Vang, C. K., Wolfe, E. P., Mayer, D. A., Lesiyon, R. L., Ravi, J.2026-07-13
💻 bioinformatics

Capabilities, specificity gaps and training-data dependence of AlphaFold3 across diverse application areas

Questo articolo valuta le prestazioni di AlphaFold3 in diverse applicazioni biomolecolari, riscontrando che, sebbene offra potenti capacità di modellazione all-atom, la sua accuratezza e affidabilità sono disomogenee e fortemente dipendenti dalla sovrapposizione con il set di addestramento, rendendo necessaria una cauta interpretazione rispetto al suo predecessore.

Follonier, O., Liu, Y., Campomanes, P., Lafrenaye, L., Racle, J., Alvarez, D., van Gerwen, J., Heinzmann, R., Jänes, J. (…)2026-07-13
💻 bioinformatics

Genomic Annotation Infrastructure (GAIn): Pipelines and Resource Repositories for Annotating Variants, Positions, and Regions

La Genomic Annotation Infrastructure (GAIn) è una piattaforma che consente l'annotazione trasparente, riproducibile e scalabile delle varianti genomiche attraverso pipeline dichiarative, repository di risorse pubbliche e interfacce web e a riga di comando flessibili che supportano estensioni personalizzate e la ri-annotazione automatizzata.

Cokol, M., Chorbadjiev, L., Lee, Y.-h., Jamsandekar, M., Gergova, I., Todorov, I., Iossifov, I.2026-07-12
💻 bioinformatics

A geometric atlas of how ESM3 organizes modalities across depth

Questo studio rivela che nel modello linguistico proteico multimodale ESM3, diverse modalità fisiche (sequenza, struttura, struttura secondaria e accessibilità al solvente) occupano inizialmente sottospazi separati prima di fondersi in una rappresentazione condivisa a bassa dimensionalità tra gli strati 25 e 35, mentre le annotazioni funzionali rimangono ortogonali per tutto il processo, con questa fusione che è una proprietà appresa e universale, indipendente dalla lunghezza della proteina ma ritardata dal disordine strutturale.

Steenwyk, J. L.2026-07-12
💻 bioinformatics

ProtBLIP2-SST: Protein Function Prediction via BLIP2 with Sequence, Structure, and Text

ProtBLIP2-SST è un nuovo framework in due fasi che integra informazioni sulla sequenza proteica e sulla struttura 3D tramite un modello linguistico consapevole della struttura e un proiettore Q-Former per consentire ai grandi modelli linguistici di generere didascalie funzionali flessibili e aperte, superando così i limiti della tradizionale classificazione rigida della Gene Ontology.

Chen, Z., Luo, Q.2026-07-12
💻 bioinformatics

EcoMorph: Universal morphological trait quantification from natural language prompts for ecological research

EcoMorph è un sistema modulare che sfrutta il modello Segment Anything Model 3 (SAM3) basato su prompt per quantificare accuratamente i tratti morfologici come area, dimensione e abbondanza in diversi contesti ecologici senza richiedere un addestramento specifico per ogni taxon, abilitando così la ricerca ecologica ad alto rendimento da fonti di immagini eterogenee.

Amoah, E. I., Bunch, Z., Thomas, H. M., Patch, H. M., Grozinger, C.2026-07-12
💻 bioinformatics

Tokenizing single-cell transcriptomes as a native language for large language models

Il documento introduce CellTok, un approccio innovativo che tokenizza i profili trascrittomici continui a singola cellula in sequenze discrete compatibili con grandi modelli linguari preaddestrati, consentendo così un framework unificato per l'elaborazione congiunta di dati cellulari, contesto biologico e istruzioni testuali per eseguire compiti diversificati come l'identificazione cellulare, l'inferenza di malattie e la generazione di stati.

Xiao, C., Ding, Y., Bian, H., Chen, Y., Wei, L., Zhang, X.2026-07-11
💻 bioinformatics

scDiagnostics: systematic assessment of cell type annotation in single-cell transcriptomics data

Il documento presenta scDiagnostics, un pacchetto R open-source progettato per rilevare sistematicamente annotazioni di tipi cellulari complesse o fuorvianti nei dati di trascrittomica a singola cellula, affrontando così una lacuna critica negli attuali flussi di lavoro di analisi garantendo l'affidabilità delle interpretazioni a valle.

Christidis, A., Ghazi, A. R., Chawla, S., Turaga, N., Gentleman, R., Geistlinger, L.2026-07-11
💻 bioinformatics

onsite: An Integrated Framework for Phosphosite Localization and False Localization Rate Estimation

Il documento presenta **onsite**, un framework Python open-source che integra una strategia di alanina-decoy per standardizzare la stima del tasso di falso localizzazione attraverso molteplici algoritmi di localizzazione di fosfosite, dimostrando una scalabilità e un'accuratezza superiori su dataset di spettrometria di massa su larga scala.

Yue, Q.-X., Wei, Z., Dai, C., Bai, M., Perez-Riverol, Y., Sachsenberg, T.2026-07-11
💻 bioinformatics

PKProbDesign: RNA inverse folding including pseudoknots by optimizing thermodynamic folding probability

PKProbDesign è un nuovo framework basato sul campionamento che affronta la sfida del ripiegamento inverso dell'RNA per strutture con pseudonodi ottimizzando direttamente le probabilità di ripiegamento termodinamico attraverso la decomposizione dello scaffold e la valutazione dell'ensemble condizionale, superando i metodi esistenti come DesiRNA e MODENA su target di benchmark.

Otagaki, T., Iwakiri, J., terai, g., Asai, K., Sato, K.2026-07-11