Using LLMs for Ontology generation by video summarization
Este artigo apresenta um algoritmo de duas fases que utiliza Grandes Modelos de Linguagem para gerar automaticamente ontologias RDF a partir de URLs de vídeos do YouTube, primeiro criando um resumo textual e depois convertendo-o em uma representação de domínio estruturada, alcançando 90% de precisão em um conjunto de dados esportivos.
Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Na vasta paisagem da informação digital, existe um desafio persistente: como ensinar os computadores não apenas a armazenar dados, mas a compreender as relações entre ideias. Imagine uma biblioteca onde cada livro é arquivado pela cor de sua capa em vez de seu assunto; encontrar uma história específica seria quase impossível. No mundo da computação, este problema é resolvido através da criação de "ontologias". Pense em uma ontologia como um mapa estruturado de conhecimento para um campo específico, como esportes ou medicina. Ela define os conceitos fundamentais dentro desse campo e, crucialmente, desenha as linhas que os conectam. Este mapa permite que as máquinas raciocinem, pesquisem e compartilhem informações de uma forma que mimetiza a compreensão humana. No entanto, construir esses mapas tem sido tradicionalmente um processo lento e caro, exigindo equipes de especialistas humanos para definir manualmente cada termo e conexão. À medida que o volume de conteúdo digital explode, particularmente em formatos de vídeo, os antigos métodos de construção manual estão lutando para acompanhar o ritmo.
Uma nova abordagem, detalhada em uma pesquisa recente do Dr. Khaled Omar, da Universidade de Damasco, tenta contornar o gargalo do trabalho humano usando inteligência artificial avançada para construir esses mapas de conhecimento diretamente a partir de vídeos. O estudo foca em um tipo específico de inteligência artificial conhecido como modelos de linguagem de grande escala — sistemas treinados em quantidades massivas de texto que podem ler, compreender e gerar linguagem humana com uma fluência notável. Embora esses modelos tenham sido usados anteriormente para resumir textos, esta pesquisa faz uma pergunta mais ousada: eles conseguem assistir a um vídeo, compreender sua mensagem central e construir automaticamente um mapa de conhecimento formal sobre o assunto? A resposta, segundo o estudo, é um "sim" promissor. Os pesquisadores desenvolveram um sistema de duas etapas que primeiro transforma um vídeo em um resumo escrito conciso e, em seguida, transforma esse resumo em um formato de dados estruturado que os computadores possam usar para raciocinar sobre o conteúdo do vídeo.
O processo começa com uma entrada simples: um link para um vídeo no YouTube. O sistema não assiste ao vídeo da maneira que um humano faz, processando imagens em movimento. Em vez disso, ele primeiro extrai as palavras faladas do vídeo, criando uma transcrição de texto. Esta transcrição é então alimentada em um poderoso modelo de inteligência artificial chamado Llama 3.2, que os pesquisadores executaram em seus próprios computadores locais para evitar custos de nuvem. O modelo atua como um editor habilidoso, lendo a transcrição e dividindo-a em partes gerenciáveis. Ele resume cada seção e depois combina esses resumos em uma narrativa única e coerente. Esta narrativa não é apenas uma coleção aleatória de frases; ela é cuidadosamente estruturada para destacar o tema principal do vídeo, identificar as pessoas ou objetos mais importantes mencionados e extrair as conclusções principais. O resultado é uma história baseada em texto limpa que captura a essência do vídeo original.
Uma vez que este resumo textual está pronto, o sistema passa para sua segunda fase: transformar a história em um mapa formal. Aqui, um modelo diferente de inteligência artificial, o Gemini Pro 002, assume o controle. Os pesquisadores fornecem a este modelo um conjunto específico de instruções, ou um "prompt", dizendo a ele para agir como um arquiteto de conhecimento. O modelo é solicitado a olhar para o resumo, identificar o domínio do vídeo e listar os conceitos principais encontrados nele. Ele então pega esses conceitos e começa a desenhar as conexões entre eles, definindo como eles se relacionam uns com os outros. Finalmente, o modelo exporta esta estrutura em um formato padrão conhecido como RDF, que é uma forma de escrever dados que permite que diferentes sistemas de computador troquem e compreendam a informação de forma integrada. Todo o fluxo de trabalho, desde um link de vídeo bruto até um mapa de conhecimento estruturado, acontece automaticamente, sem necessidade de intervenção humana para definir os termos ou as relações.
Para testar se este método automatizado realmente funciona, os pesquisadores o aplicaram a um conjunto de dados de cem vídeos focados em esportes. Eles não apenas deixaram o sistema rodar e esperaram pelo melhor; eles mediram seu desempenho contra um alto padrão. Para a primeira parte do processo, a sumarização do vídeo, eles compararam o resumo escrito da IA com o título original do vídeo para ver o quão bem eles correspondiam em significado. O sistema alcançou um alto nível de concordância, com os resumos alinhando-se com os títulos cerca de noventa e cinco por cento das vezes. Para a segunda parte, a criação do mapa de conhecimento, os pesquisadores compararam o mapa gerado pela IA contra um mapa criado por um especialista humano. Este é o verdadeiro teste de se a máquina entende a estrutura do conhecimento, não apenas as palavras. Nesta comparação, o sistema automatizado recriou com sucesso o mapa do especialista humano com uma taxa de precisão de oitenta e cinco por cento. Ao observar todo o processo como um todo, os pesquisadores calcularam uma precisão geral de noventa por cento.
As implicações deste trabalho são significativas para a forma como gerenciamos o crescente oceano de conteúdo de vídeo na internet. Ao automatizar a criação desses mapas de conhecimento, o sistema reduz a dependência pesada de especialistas humanos, tornando possível organizar e compreender dados de vídeo em uma escala que era anteriormente impossível. Os pesquisadores observam que, embora tenham testado isso em vídeos de esportes, o método não se limita a esse campo; ele pode ser aplicado a palestras médicas, tutoriais educacionais ou qualquer domínio onde o vídeo seja uma fonte primária de informação. O estudo sugere que o futuro da organização do conhecimento digital pode residir nestes sistemas híbridos, onde a inteligência artificial cuida do trabalho pesado de extração e estruturação, permitindo que os humanos se concentrem na validação e aplicação de nível superior. A pesquisa é uma demonstração de que, com as ferramentas certas, a tarefa complexa de transformar uma imagem em movimento em uma compreensão estruturada e legível por máquina do mundo não é mais apenas uma possibilidade teórica, mas uma realidade prática.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.