← Últimos artigos
🤖 machine learning

S3-Tracker: Self-Supervised Surgical Tissue Tracking With Contrastive Random Walks

Este artigo apresenta o S3-Tracker, um método autossupervisionado que utiliza passeios aleatórios contrastivos em vídeos endoscópicos não rotulados para alcançar um rastreamento de tecido cirúrgico robusto comparável a abordagens semissupervisionadas, superando, assim, o desafio de obter grandes conjuntos de dados anotados para intervenção auxiliada por computador.

Autores originais: Jiaming Zhang, Zijian Wu, Mehran Armand, Septimiu Salcudean

Publicado 2026-09-15
📖 4 min de leitura☕ Leitura rápida

Autores originais: Jiaming Zhang, Zijian Wu, Mehran Armand, Septimiu Salcudean

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Dentro do corpo humano, a visão de uma câmera cirúrgica é frequentemente uma paisagem mutável de tecido macio e úmido que se estica, dobra e desliza sob a pressão de instrumentos. Para os cirurgiões e os robôs que os auxiliam, manter um mapa mental constante de onde cada pedaço de tecido está localizado é um desafio contínuo. Se um cirurgião precisa corresponder o que vê em uma tela com um exame pré-operatório, como uma TC ou RM, a tarefa torna-se quase impossível quando o tecido se deforma em tempo real. Para resolver isso, os computadores precisam rastrear pontos específicos no tecido de um quadro de vídeo para o próximo, mantendo uma conexão contínua entre a visão ao vivo e a anatomia interna do paciente. Embora a inteligência artificial moderna tenha se tornado muito boa em seguir objetos em vídeos padrão, a realidade caótica da cirurgia — repleta de sangue, fumaça e superfícies altamente reflexivas — tornou difícil ensinar os computadores a fazer isso de forma confiável sem quantidades massivas de dados rotulados por humanos.

Uma equipe de pesquisadores desenvolveu uma nova maneira de ensinar computadores a rastrear o tecido cirúrgico sem a necessidade desses rótulos difíceis de obter. Em vez de mostrar ao computador milhares de vídeos onde humanos desenharam meticulosamente pontos e linhas para mostrar o movimento, o novo método, chamado S3-Tracker, aprende assistindo ao próprio vídeo e verificando seu próprio trabalho. O sistema trata o vídeo como uma série de momentos conectados e faz uma pergunta simples: se eu me mover do ponto A em um quadro para o ponto B no próximo, e depois tentar voltar do ponto B para o A, eu terminarei exatamente onde comecei? Ao forçar o computador a responder a essa pergunta corretamente repetidas vezes, ele aprende a entender como os pixels se movem e se deformam, mesmo quando o tecido parece muito diferente de um momento para o outro. Essa abordagem permite que o sistema aprenda com vastas quantidades de filmagens cirúrgicas não rotuladas, contornando o gargalo de precisar de especialistas humanos para anotar cada quadro individualmente.

Os pesquisadores construíram seu sistema para analisar pares de quadros de vídeo e descobrir como os pixels de um se relacionam com os pixels do próximo. Eles utilizam um processo que cria um mapa de conexões entre esses pontos, essencialmente pedindo ao computador para adivinhar o caminho mais provável que um pedaço de tecido percorreu. Para garantir que o computador não esteja apenas adivinhando aleatoriamente, o sistema verifica sua própria lógica executando o movimento para frente e depois para trás. Se o caminho de ida e o caminho de volta não se encontrarem no mesmo lugar, o sistema sabe que cometeu um erro e ajusta seu entendimento. Esse mecanismo de autocontrole, que os autores chamam de caminhada aleatória contrastiva (contrastive random walk), permite que o modelo aprenda as formas complexas como o tecido estica e dobra sem nunca ver uma única resposta correta fornecida por um humano. O sistema também inclui uma maneira de decidir quando um ponto não está mais visível, talvez por ter sido coberto por sangue ou por um instrumento, e interrompe o rastreamento até que ele reapareça, evitando que o computador se confunda e se desvie do curso.

Quando testado em conjuntos de dados de vídeos cirúrgicos reais, o novo método provou ser um forte concorrente contra sistemas existentes que dependem de rotulagem humana parcial. Os pesquisadores descobriram que sua abordagem autossupervisionada poderia rastrear pontos com uma precisão que rivaliza com métodos treinados com alguma orientação humana, sendo significamente mais rápido para rodar em tempo real. Em testes medindo o quão distantes os pontos previstos estavam da verdade fundamental (ground truth) real, o sistema teve um desempenho bom o suficiente para ser considerado viável para uso clínico, alcançando uma pontuação de precisão média de 0,708 em vários limiares de erro. Embora modelos totalmente supervisionados, que utilizam rótulos humanos completos, possam às vezes ser ligeiramente mais precisos em termos de distância de erro bruta, eles são frequentemente lentos demais para trabalhar quadro a quadro durante uma cirurgia ao vivo. O novo método, por outro lado, opera de forma eficiente o suficiente para acompanhar o fluxo de vídeo, processando quadros a uma taxa de três vezes por segundo. Essa velocidade, combinada com sua capacidade de lidar com o caos visual da cirurgia sem precisar de dados pré-rotulados, sugere que o rastreamento autossupervisionado pode se tornar uma ferramenta prática para guiar a cirurgia robótica e ajudar os cirurgiões a navegar pelo terreno complexo e móvel do corpo humano.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →