← Últimos artigos
💻 computer science

Cross-Generation Optimization of YOLOv26, YOLOv11, and YOLOv8 for Fine-Grained Small-Object Detection and Instance Segmentation in Complex Orchards

Este estudo avalia o desempenho dos modelos Ultralytics YOLOv8, YOLOv11 e YOLOv26 em várias escalas e resoluções para identificar que modelos compactos treinados em entradas de alta resolução (especificamente YOLOv11s-960 e YOLOv26s-960) oferecem a relação mais eficaz entre precisão e eficiência para a detecção de objetos pequenos de detalhamento fino e segmentação de instâncias em ambientes de pomares complexos.

Autores originais: Ranjan Sapkota, Manoj Karkee

Publicado 2026-08-26
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Ranjan Sapkota, Manoj Karkee

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Nas fileiras silenciosas e banhadas pelo sol de um pomar de maçãs comercial, um desafio sutil, mas difícil, aguarda as máquinas do futuro. Durante décadas, a visão computacional aprendeu a reconhecer objetos, encontrando carros no trânsito ou pessoas em multidões com uma velocidade notável. Mas quando essas mesmas máquinas olham para uma jovem macieira no início do verão, a tarefa torna-se surpreendentemente difícil. O fruto é minúsculo, muitas vezes não maior que uma unha, e está escondido dentro de um emaranhado denso e caótico de folhas verdes, caules e ramos que parecem quase idênticos ao próprio fruto. Este ambiente "verde sobre verde" cria um enigma visual onde o alvo se mistura perfeitamente ao fundo. Para construir robôs que possam cuidar dessas árvores — talvez para ralear o excesso de frutos para que os restantes cresçam grandes e doces — os engenheiros precisam de mais do que apenas uma câmera que veja um fruto. Eles precisam de um sistema que consiga distinguir o caule delicado e filamentoso que segura o fruto, a pequena taça na sua base e o corpo do próprio fruto, mesmo quando estão parcialmente ocultos ou têm apenas alguns pixels de largura numa tela.

Este é o problema específico abordado por uma equipa de investigadores da Universidade de Cornell, que se propôs a testar quão bem a inteligência artificial moderna lida com estes detalhes minúsculos e ocultos. Eles focaram-se numa família de modelos de IA conhecidos como YOLO, que são famosos pela sua capacidade de detetar objetos em tempo real. A equipa não inventou um novo tipo de IA; em vez disso, atuaram como experimentadores cuidadosos, pegando em três gerações diferentes destes modelos — o estabelecido YOLOv8, o mais recente YOLOv11 e o muito recente YOLOv26 — e testando-os sob uma grande variedade de condições. Eles queriam saber duas coisas: um modelo de IA maior e mais complexo funciona sempre melhor para estes alvos minúsculos, e alimentar a IA com uma imagem mais nítida e de maior resolução ajuda-a a ver o que de outra forma poderia perder? Para descobrir, treinaram trinta versões diferentes destes modelos num conjunto de dados de 600 imagens tiradas num pomar de maçãs real em Washington state, onde o fruto estava no seu menor tamanho e mais difícil de detetar.

Os resultados deste extenso teste revelaram uma verdade contraintuitiva sobre como estas máquinas aprendem a ver. Durante muito tempo, a suposição no campo tem sido que, se quiser um melhor desempenho, basta ter um "cérebro" maior. No mundo da IA, isto significa usar um modelo com mais camadas e mais parâmetros, dando essencialmente ao computador mais memória e poder de processamento para analisar a imagem. Os investigadores testaram isto comparando as versões mais pequenas dos modelos, conhecidas como "nano", contra as versões massivas "extra-large". Eles descobriram que tornar o modelo maior não garantia melhores resultados. Na verdade, os modelos maiores, mais pesados computacionalmente, muitas vezes falhavam em superar os seus primos muito menores e mais eficientes. Os modelos maiores por vezes perdiam de vista os caules minúsculos ou tinham dificuldade em desenhar os limites precisos do fruto, apesar de terem muito mais poder de computação à sua disposição.

Em vez disso, a chave para ver estes objetos pequenos claramente residia na forma como as imagens eram apresentadas à IA durante o treino. Os investigadores compararam duas abordagens: uma onde as imagens eram reduzidas para um tamanho padrão de 640 por 640 pixels, e outra onde as imagens eram mantidas numa resolução mais alta de 960 por 960 pixels. Quando as imagens eram reduzidas, os caules minúsculos e os pequenos corpos dos frutos perdiam detalhe, tornando-se borrados ou desaparecendo no ruído das folhas de fundo. Ao manter a resolução mais alta, os investigadores preservaram os detalhes espaciais finos que a IA precisava para compreender a cena. Esta abordagem de maior resolução ajudou consistentemente os modelos, mas não ajudou todos os modelos da mesma forma. As melhorias mais significativas foram observadas nos modelos de tamanho pequeno a médio. Estes modelos compactos, quando treinados nas imagens mais nítidas, foram capazes de detetar e delinear as partes minúsculas do fruto com um nível de precisão que os modelos massivos não conseguiam igualar, mesmo quando os modelos massivos recebiam as mesmas imagens de alta resolução.

O estudo destacou que a dificuldade da tarefa varia dependendo de qual parte do fruto o robô precisa de ver. O corpo principal do fruto jovem, que é mais arredondado e maior, era relativamente fácil para a IA encontrar. A taça da flor na base do fruto era mais difícil, mas ainda gerível. O alvo mais difícil era o pedúnculo, o caule fino e semelhante a uma agulha que liga o fruto ao ramo. Esta estrutura é tão estreita e frequentemente tão obscurecida pelas folhas que é facilmente perdida quando uma imagem é redimensionada ou quando o modelo de IA não é ajustado corretamente. Os investigadores descobriram que os modelos pequenos treinados em imagens de alta resolução foram os mais bem-sucedidos a encontrar estes caules. Por exemplo, um dos modelos pequenos, quando treinado nas imagens de 960 pixels, alcançou um alto nível de precisão na identificação do fruto e das suas partes, utilizando apenas uma fração da potência de computação exigida pelos modelos maiores. Os modelos maiores, por outro lado, exigiam significativamente mais tempo para processar cada imagem e consumiam muito mais energia, mas não produziam melhores resultados. Em alguns casos, os modelos maiores tiveram, de facto, um desempenho pior, sugerindo que adicionar mais complexidade pode por vezes confundir a IA em vez de ajudar.

Este trabalho oferece um guia claro para engenheiros que constroem robôs para a agricultura. Sugere que o caminho para uma melhor perceção não é necessariamente construir computadores maiores e mais caros, mas sim ser mais inteligente na forma como os dados são preparados. Ao focar-se na preservação dos detalhes finos da imagem e ao combinar isso com um modelo que seja apenas grande o suficiente para lidar com a tarefa, é possível alcançar uma alta precisão sem o pesado custo computacional. Os investigadores descobriram que um modelo pequeno treinado em imagens de alta resolução podia identificar o fruto e as suas partes delicadas com uma precisão que rivaliza ou excede a dos sistemas mais poderosos disponíveis. Esta é uma descoberta crucial para o futuro da agricultura robótica, onde os robôs precisam de operar de forma rápida e eficiente no campo, muitas vezes com recursos de energia e computação limitados. O estudo conclui que, para o desafio específico de ver objetos minúsculos e ocultos num ambiente verde complexo, a combinação de um modelo compacto e uma visão nítida é muito mais eficaz do que simplesmente lançar mais poder de computação sobre o problema. A implementação destes modelos e os dados utilizados estão agora disponíveis para que outros os utilizem, fornecendo uma base prática para a próxima geração de robôs agrícolas que podem ver o pomar não apenas como um borrão verde, mas como uma coleção de estruturas individuais e delicadas à espera de serem cuidadas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →