← Últimos artigos
🧬 biology

YAPAT — An Open-Source Platform for Active and Weakly Supervised Annotation of Passive Acoustic Monitoring Data

O YAPAT é uma plataforma de código aberto, baseada na web, que otimiza a anotação em larga escala de dados de monitoramento acústico passivo ao integrar rotulagem fundamentada em ontologia, aprendizado ativo de múltiplos rótulos e mecanismos duplos de inicialização a frio para reduzir o esforço do especialista e produzir conjuntos de dados interoperáveis de alta qualidade.

Autores originais: Thiago S. Gouvêa, Rida Saghir, Prathmesh P. Doddanawar, Novruz Mammadli, Pratik P. Sitapara, Hannes Kath, Daniel Sonntag

Publicado 2026-07-31
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Thiago S. Gouvêa, Rida Saghir, Prathmesh P. Doddanawar, Novruz Mammadli, Pratik P. Sitapara, Hannes Kath, Daniel Sonntag

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Esta é uma explicação gerada por IA de um preprint que não foi revisado por pares. Não é aconselhamento médico. Não tome decisões de saúde com base neste conteúdo. Ler aviso legal completo

Imagine o mundo natural como uma estação de rádio gigante, de 24 horas, que nunca para de transmitir. Em vez de música, ela toca os cantos de sapos, pássaros, insetos e baleias. Cientistas usam microfones especiais, chamados unidades de Monitoramento Acústico Passivo (MAP), para gravar esses sons por dias, semanas ou até anos. Isso é um superpoder para entender a natureza porque permite que os pesquisadores ouçam ecossistemas inteiros sem nunca pisar neles ou assustar os animais. No entanto, há um problema enorme: esses microfones gravam tanto áudio que os arquivos se acumulam em uma montanha grande demais para qualquer humano ouvir e anotar o que ouve. É como tentar ler todos os livros de uma biblioteca do tamanho de uma cidade, mas os livros são feitos de som.

Para resolver isso, os cientistas usam computadores para ajudar a ouvir. Mas os computadores são apenas tão inteligentes quanto os exemplos com os quais são ensinados. Para ensinar um computador a reconhecer o chamado de um sapo específico, um especialista humano primeiro precisa ouvir milhares de gravações e rotulá-las, dizendo: "Sim, isto é um sapo" ou "Não, isto é apenas o vento". Esse processo é lento, entediante e caro. Se os especialistas estiverem ocupados demais rotulando, os computadores não conseguem aprender, e as montanhas de dados de áudio ficam inúteis paradas. A grande questão neste campo é: Como podemos fazer com que os computadores aprendam com esses arquivos de áudio massivos sem precisar que um humano ouça cada segundo primeiro?

É aqui que entra uma nova ferramenta chamada YAPAT (Yet Another PAM Annotation Tool) – Traduzindo: "Mais uma Ferramenta de Anotação de MAP". Pense no YAPAT como um jogo de detetive de alta tecnologia e interativo para sons da natureza. Em vez de forçar um humano a ouvir cada gravação um por um, o YAPAT usa uma mistura inteligente de truques de computador para fazer o trabalho pesado. Ele começa quebrando os arquivos de áudio longos em pequenos clipes de 3 segundos. Em seguida, utiliza um "cérebro" pré-treinado (chamado BirdNET) para transformar cada clipe em uma impressão digital digital única.

A mágica acontece na forma como o YAPAT ajuda o especialista humano. Imagine que você está olhando para um mapa gigante de todas essas impressões digitais de som; o YAPAT não mostra apenas uma lista aleatória; ele atua como um guia inteligente. Ele possui três formas principais de te dar um ponto de partida, mesmo que você tenha zero dados rotulados para começar:

  1. A Busca por "Semelhantes": Se você tiver uma gravação clara de um animal específico, pode fazer o upload dela. O YAPAT encontra instantaneamente todos os outros clipes de 3 segundos em seu vasto arquivo que soam semelhantes, permitindo que você rotule um monte deles de uma só vez.
  2. O Palpite de "Nível de Arquivo": Se você tiver uma pasta de gravações onde sabe apenas qual animal estava no arquivo (mas não exatamente quando), o YAPAT pode usar uma técnica chamada "supervisão fraca" para adivinhar onde no arquivo o animal está cantando. É como olhar para uma foto de uma festa e adivinhar quem está dançando com base na energia da multidão, mesmo que você não tenha filmado a pista de dança diretamente.
  3. A "Classificação Inteligente": Assim que o computador começa a aprender, ele para de mostrar clipes aleatórios. Em vez disso, utiliza um sistema de pontuação especial para mostrar os clipes sobre os quais ele está mais confuso, ou aqueles que são mais diferentes do que ele já conhece. Isso garante que o especialista humano gaste seu tempo apenas nos clipes que mais ensinarão o computador, em vez de perder tempo com exemplos fáceis ou entediantes.

O YAPAT também conecta esses rótulos de som a dicionários científicos oficiais (ontologias), garantindo que, quando um cientista disser "sapo-árvore", isso signifique exatamente a mesma coisa para todos no mundo, tornando os dados reutilizáveis para pesquisas futuras.

O artigo apresenta o YAPAT como uma plataforma baseada na web que reúne todos esses recursos em um só lugar. Os autores testaram o sistema em um conjunto de dados real chamado AnuraSet, que contém mais de 30.000 clipes de sons de sapos. Eles descobriram que o sistema funciona rápido o suficiente para ser interativo. Por exemplo, buscar sons semelhantes leva menos de um segundo, mesmo com milhares de clipes. Treinar o computador para reconhecer novos padrões leva apenas alguns segundos em um computador padrão, ou até mais rápido em um computador potente. O sistema foi projetado para ser de código aberto, o que significa que qualquer pessoa pode baixá-lo, configurá-lo em seu próprio servidor e começar a organizar seus próprios arquivos de som.

Os autores ressaltam cuidadosamente que, embora o YAPAT seja uma ferramenta poderosa, ele não é uma varinha mágica que resolve tudo instantaneamente. Ele depende do "cérebro" BirdNET, que foi originalmente treinado para pássaros, portanto, pode não ser perfeito para todos os tipos de animais (como morcegos ou baleias) sem alguns ajustes extras. Além disso, o sistema atualmente corta os sons em blocos fixos de 3 segundos, o que significa que não consegue identificar o milissegundo exato em que um som começa ou termina se ele cair na borda de um corte. No entanto, ao combinar busca inteligente, supervisão fraca e aprendizado ativo, o YAPAT consegue, com sucesso, unir a lacuna entre arquivos de áudio massivos e ingovernáveis e os dados de alta qualidade e rotulados que os cientistas precisam para entender a biodiversidade do nosso planeta. Ele transforma a tarefa impossível de ouvir tudo em um jogo colaborativo e gerenciável, onde humanos e computadores trabalham juntos para decodificar a canção da natureza.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →