Robôs aprendem novas habilidades vendo um único vídeo de 29 segundos

Imagem de um homem fazendo movimentos para um robô dentro um laboratório de robótica ilustra o post cujo título diz que os robôs aprendem novas habilidades vendo um único vídeo de 29 segundos.
Imagem ilustrativa gerada por inteligência artificial, representando um robô aprendendo uma nova habilidade a partir de uma demonstração humana. Crédito: ChatGPT /OpenAI.
Compatilhe este artigo

Para operar de forma confiável em ambientes reais dinâmicos, os robôs devem ser capazes de adquirir novas habilidades rapidamente, sem passar por treinamentos adicionais extensivos. No entanto, a maioria dos sistemas robóticos existentes apresenta bom desempenho principalmente nas tarefas para as quais foi treinada.

Ensinar robôs a realizar novas tarefas pode ser demorado e caro. Além disso, treinamentos adicionais às vezes prejudicam seu desempenho em tarefas aprendidas anteriormente.

Pesquisadores do Instituto de Tecnologia de Beijing, da X SQUARE ROBOT e da Universidade Tsinghua desenvolveram recentemente o HOST (Human-to-robot One-Shot Skill AcquisiTion), uma nova estrutura que pode permitir que robôs adquiram novas habilidades de maneira mais rápida e eficiente. A abordagem de aprendizado proposta, apresentada em um artigo publicado no servidor arXiv, permite que um robô adquira uma nova habilidade a partir de um único vídeo que faz uma demonstração humana, sem comprometer habilidades adquiridas anteriormente.

“A capacidade de adquirir habilidades de forma rápida e sem esforço, mantendo aquelas já dominadas, é essencial para os robôs”, escreveram Guangyan Chen, Meiling Wang e seus colegas no artigo.

“No entanto, os métodos atuais ainda dependem de um ciclo trabalhoso durante o treinamento, que é caro e lento, ao mesmo tempo em que prejudica as habilidades já dominadas. Apresentamos o HOST, uma estrutura que permite um robô adquirir as habilidades em segundos a partir de um único vídeo humano, mantendo as habilidades dominadas anteriormente”.

Como o HOST transforma demonstrações humanas em ações dos robôs

A estrutura desenvolvida [pelos pesquisadores] permite que os robôs adquiram uma nova habilidade simplesmente analisando um vídeo que mostra uma demonstração humana. Isso é realizado em três etapas principais.

Primeiro, o HOST utiliza imagens capturadas por câmeras para determinar até que ponto o robô avançou no procedimento mostrado no vídeo humano. Em outras palavras, ele identifica a parte da demonstração que corresponde ao estágio atual do robô.

Em seguida, a estrutura examina a parte seguinte da demonstração humana e prevê o que o próprio robô deve esperar observar à medida que avança na tarefa. Essa etapa intermediária ajuda o HOST a levar em conta as diferenças entre o corpo do demonstrador humano e a estrutura física do robô.

Por fim, o HOST determina as ações que o robô deve realizar a partir dessas observações futuras previstas. Ao determinar repetidamente seu progresso atual, antecipar o que deve observar em seguida e selecionar as ações correspondentes, o robô pode seguir o procedimento demonstrado enquanto o adapta à sua própria estrutura corporal.

Embora o HOST adquira uma nova habilidade a partir de um único vídeo sem atualizar seus parâmetros, a estrutura subjacente foi previamente treinada usando 193.462 trajetórias robóticas abrangendo 229 tarefas. Posteriormente, ela foi adaptada usando 5.847 vídeos de demonstrações humanas, cada um associado a trajetórias robóticas para as tarefas demonstradas.

“O HOST resolve a aquisição de habilidades por meio de uma cascata de previsão fundamentada em si mesma. Primeiro, ele estima o progresso do robô dentro da tarefa demonstrada; depois, traduz o progresso seguinte nas próprias observações futuras do robô e, por fim, deriva as ações a partir dessas observações previstas”, escreveram os autores.

“Essa cascata é treinada com alvos associados à demonstração em vídeo, obtidos pelo mapeamento da trajetória robótica e da demonstração em vídeo em uma representação compartilhada do progresso da tarefa, redefinindo então cada alvo para alinhá-lo ao progresso futuro do vídeo. Dessa forma, o HOST permite que o robô acompanhe ativamente o procedimento demonstrado e o adapte à sua própria estrutura física”.

Um possível caminho para uma aquisição mais rápida de habilidades robóticas

Os pesquisadores avaliaram sua estrutura em testes no mundo real com um sistema robótico, o qual era composto por dois braços ARX R5 de seis eixos, cada um equipado com uma garra de mandíbulas paralelas, e três câmeras RGB.

O robô foi testado em 50 tarefas físicas de manipulação que não haviam sido vistas anteriormente, envolvendo objetos e ferramentas diferentes e exigindo movimentos distintos. Ele tentou realizar cada tarefa 20 vezes, com os objetos colocados em posições iniciais diferentes ou orientações diferentes a cada tentativa. Os avaliadores humanos determinaram se cada tentativa poderia ser considerada bem-sucedida.

“O HOST adquire habilidades novas no momento da inferência a partir de um único vídeo humano de 29 segundos, em média, e alcança uma taxa média de sucesso de 62%”, escreveram [os autores]. “Ele supera a referência de zero-shot em 45%, enquanto mantém as habilidades dominadas anteriormente. O HOST chega a superar a referência ajustada com 50 demonstrações robóticas por tarefa, exigindo 50 vezes menos demonstrações e adquirindo cada habilidade 507 vezes mais rápido”.

Os resultados dos testes iniciais destacam o potencial do HOST para ensinar habilidades novas aos robôs de forma mais rápida e sem demonstrações extensivas e específicas para cada tarefa. No futuro, a tecnologia poderá ser aprimorada para aumentar sua taxa de sucesso e ser testada em outros robôs ou em uma gama mais ampla de cenários.

Detalhes da publicação

Guangyan Chen et al. Robots Acquire Manipulation Skills in Seconds from a Single Human Video, arXiv (2026). DOI: 10.48550/arxiv.2607.20033

Informações sobre a publicação: arXiv

Fonte: arXiv

Artigo original (em inglês) publicado por Ingrid Fadelli na TechXplore.

SOBRE A AUTORA
Ingrid Fadelli

Jornalista freelancer e entusiasta da ciência, com bacharelado em Psicologia e mestrado em Jornalismo Internacional pela City University of London. Começou a escrever para a Science X em 2018 e seus principais interesses incluem IA, robótica, ciência ambiental, entre outros temas.

Visando otimizar a produção, usamos nosso assistente de IA, BLIP, para traduzir este artigo, mas sob supervisão humana para garantir a qualidade exigida pelos padrões editoriais da Sustenare News.


Compatilhe este artigo

Outros Posts