CuriosAI Submission to the CASTLE Challenge at EgoVis 2026
A equipe da CuriosAI apresenta duas abordagens, SVA e TMKG, para o Desafio CASTLE no EgoVis 2026, com seu pipeline de três etapas Buscar-Verificar-Responder alcançando uma precisão de 0,50 no ranking em 185 perguntas de múltipla escolha derivadas de mais de 600 horas de vídeo egocêntrico multiview sincronizado.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está tentando resolver um mistério massivo baseado em 600 horas de filmagem de 12 pessoas vivendo juntas, gravadas simultaneamente por 15 câmeras diferentes. O desafio? Responder a 185 perguntas específicas de múltipla escolha sobre o que aconteceu, quem fez e quando.
Este é o Desafio CASTLE, e a equipe da SoftBank (CuriosAI) tentou duas abordagens diferentes para resolvê-lo usando inteligência artificial. Eles chamam seus métodos de SVA e TMKG.
Veja como funcionaram, explicados de forma simples:
A Base Comum: A "Biblioteca"
Antes de tentar resolver as perguntas, ambos os métodos primeiro construíram uma biblioteca massiva e organizada do vídeo. Eles não apenas assistiram ao vídeo bruto; desmontaram-no em cinco camadas úteis:
- Quem é quem: Identificando as 12 pessoas.
- O que está acontecendo: Escrevendo legendas para as cenas.
- Quais objetos estão lá: Identificando itens específicos, como jogos de tabuleiro ou utensílios de cozinha.
- O que foi dito: Transcrevendo o áudio e identificando quem falou.
- A linha do tempo: Criando um cronograma de ações para cada pessoa.
Ambos os métodos usaram essa mesma "biblioteca", mas seguiram caminhos muito diferentes para encontrar as respostas.
Abordagem A: SVA (Buscar – Verificar – Responder)
A Analogia: O Detetive com um Livro de Regras Estrito
Pense no SVA como uma equipe de três detetives trabalhando em uma linha de montagem rigorosa:
- Buscar (O Batedor): Primeiro, eles examinam toda a biblioteca e adivinham qual trecho de 15 minutos do vídeo provavelmente contém a resposta. Eles reduzem o escopo de horas para uma pequena janela.
- Verificar (O Cético): Esta é a parte mais importante. Eles pegam essa janela de 15 minutos e a dividem em clipes menores de 5 minutos. Pedem a uma IA que examine esses clipes, mas dão a ela um livro de regras estrito para impedir que ela minta (alucine).
- Regra 1: Não apenas repita a pergunta de volta para você.
- Regra 2: Se o vídeo estiver silencioso ou em branco, admita que não sabe.
- Regra 3: Se você contar algo, deve apontar exatamente onde está no vídeo.
- Regra 4: Não invente fatos se não conseguir vê-los.
- Responder (O Juiz): Finalmente, uma IA "Juíza" inteligente examina todas as evidências coletadas pelo Cético, pondera-as (confiando mais em citações de áudio do que em suposições visuais vagas) e escolhe a resposta final.
O Resultado: Este método foi muito cuidadoso. Fez muitas perguntas à IA (cerca de 28 vezes por mistério), mas acertou a resposta correta 50% das vezes. Esta foi sua submissão vencedora.
Abordagem B: TMKG (Grafo de Conhecimento Multimodal Temporal)
A Analogia: A Teia de Conexões
Pense no TMKG como a construção de uma enorme teia de aranha tridimensional de fatos.
- A cada 5 minutos, o sistema cria um "nó" (um ponto) contendo tudo o que aconteceu: quem estava lá, o que disseram e quais objetos estavam visíveis.
- Conecta esses pontos com fios (arestas) mostrando quem fez o quê, onde estavam e o que aconteceu a seguir.
- Quando uma pergunta chega, o sistema pesquisa essa teia para encontrar o agrupamento correto de pontos.
- Uma vez encontrado o local, entrega o vídeo e os dados da teia a uma única IA para fornecer a resposta imediatamente.
O Resultado: Este método foi mais rápido e fez menos perguntas à IA (apenas cerca de 1 vez por mistério), mas foi menos preciso, acertando a resposta correta apenas 35% das vezes.
A Grande Lição
A equipe comparou as duas e encontrou uma lição clara:
- SVA (O Detetive) venceu porque foi disciplinado. Ao forçar a IA a verificar seu trabalho e seguir regras estritas sobre não inventar coisas, evitou erros bobos.
- TMKG (A Teia) teve dificuldades porque confiava em uma única IA para fazer tudo de uma vez, sem aquela camada extra de "verificação de fatos".
A Conclusão:
Nesta escala massiva (600 horas de vídeo), simplesmente construir um banco de dados mais inteligente não é suficiente. O segredo foi a verificação. Embora o método do "Detetive" tenha exigido mais poder de computação e tempo para ser executado, o passo extra de forçar a IA a provar seus fatos antes de responder fez a diferença entre uma pontuação de 35% e uma de 50%.
A equipe observou que ambos os métodos às vezes falharam porque escolheram a janela errada de 15 minutos para começar. Mas concluíram que, se você conseguir encontrar a janela certa, adicionar um "verificador disciplinado" é a melhor maneira de obter a resposta correta.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.