Robôs aprendem novas habilidades vendo um único vídeo de 29 segundos
Para operar de forma confiável em ambientes reais dinâmicos, os robôs devem ser capazes de adquirir novas habilidades rapidamente, sem passar por treinamentos adicionais extensivos. No entanto, a maioria dos sistemas robóticos existentes apresenta bom desempenho principalmente nas tarefas para as quais foi treinada.
Ensinar robôs a realizar novas tarefas pode ser demorado e caro. Além disso, treinamentos adicionais às vezes prejudicam seu desempenho em tarefas aprendidas anteriormente.
Pesquisadores do Instituto de Tecnologia de Beijing, da X SQUARE ROBOT e da Universidade Tsinghua desenvolveram recentemente o HOST (Human-to-robot One-Shot Skill AcquisiTion), uma nova estrutura que pode permitir que robôs adquiram novas habilidades de maneira mais rápida e eficiente. A abordagem de aprendizado proposta, apresentada em um artigo publicado no servidor arXiv, permite que um robô adquira uma nova habilidade a partir de um único vídeo que faz uma demonstração humana, sem comprometer habilidades adquiridas anteriormente.
“A capacidade de adquirir habilidades de forma rápida e sem esforço, mantendo aquelas já dominadas, é essencial para os robôs”, escreveram Guangyan Chen, Meiling Wang e seus colegas no artigo.
“No entanto, os métodos atuais ainda dependem de um ciclo trabalhoso durante o treinamento, que é caro e lento, ao mesmo tempo em que prejudica as habilidades já dominadas. Apresentamos o HOST, uma estrutura que permite um robô adquirir as habilidades em segundos a partir de um único vídeo humano, mantendo as habilidades dominadas anteriormente”.
Como o HOST transforma demonstrações humanas em ações dos robôs
A estrutura desenvolvida [pelos pesquisadores] permite que os robôs adquiram uma nova habilidade simplesmente analisando um vídeo que mostra uma demonstração humana. Isso é realizado em três etapas principais.
Primeiro, o HOST utiliza imagens capturadas por câmeras para determinar até que ponto o robô avançou no procedimento mostrado no vídeo humano. Em outras palavras, ele identifica a parte da demonstração que corresponde ao estágio atual do robô.
Em seguida, a estrutura examina a parte seguinte da demonstração humana e prevê o que o próprio robô deve esperar observar à medida que avança na tarefa. Essa etapa intermediária ajuda o HOST a levar em conta as diferenças entre o corpo do demonstrador humano e a estrutura física do robô.
Por fim, o HOST determina as ações que o robô deve realizar a partir dessas observações futuras previstas. Ao determinar repetidamente seu progresso atual, antecipar o que deve observar em seguida e selecionar as ações correspondentes, o robô pode seguir o procedimento demonstrado enquanto o adapta à sua própria estrutura corporal.
Embora o HOST adquira uma nova habilidade a partir de um único vídeo sem atualizar seus parâmetros, a estrutura subjacente foi previamente treinada usando 193.462 trajetórias robóticas abrangendo 229 tarefas. Posteriormente, ela foi adaptada usando 5.847 vídeos de demonstrações humanas, cada um associado a trajetórias robóticas para as tarefas demonstradas.
“O HOST resolve a aquisição de habilidades por meio de uma cascata de previsão fundamentada em si mesma. Primeiro, ele estima o progresso do robô dentro da tarefa demonstrada; depois, traduz o progresso seguinte nas próprias observações futuras do robô e, por fim, deriva as ações a partir dessas observações previstas”, escreveram os autores.
“Essa cascata é treinada com alvos associados à demonstração em vídeo, obtidos pelo mapeamento da trajetória robótica e da demonstração em vídeo em uma representação compartilhada do progresso da tarefa, redefinindo então cada alvo para alinhá-lo ao progresso futuro do vídeo. Dessa forma, o HOST permite que o robô acompanhe ativamente o procedimento demonstrado e o adapte à sua própria estrutura física”.
Um possível caminho para uma aquisição mais rápida de habilidades robóticas
Os pesquisadores avaliaram sua estrutura em testes no mundo real com um sistema robótico, o qual era composto por dois braços ARX R5 de seis eixos, cada um equipado com uma garra de mandíbulas paralelas, e três câmeras RGB.
O robô foi testado em 50 tarefas físicas de manipulação que não haviam sido vistas anteriormente, envolvendo objetos e ferramentas diferentes e exigindo movimentos distintos. Ele tentou realizar cada tarefa 20 vezes, com os objetos colocados em posições iniciais diferentes ou orientações diferentes a cada tentativa. Os avaliadores humanos determinaram se cada tentativa poderia ser considerada bem-sucedida.
“O HOST adquire habilidades novas no momento da inferência a partir de um único vídeo humano de 29 segundos, em média, e alcança uma taxa média de sucesso de 62%”, escreveram [os autores]. “Ele supera a referência de zero-shot em 45%, enquanto mantém as habilidades dominadas anteriormente. O HOST chega a superar a referência ajustada com 50 demonstrações robóticas por tarefa, exigindo 50 vezes menos demonstrações e adquirindo cada habilidade 507 vezes mais rápido”.
Os resultados dos testes iniciais destacam o potencial do HOST para ensinar habilidades novas aos robôs de forma mais rápida e sem demonstrações extensivas e específicas para cada tarefa. No futuro, a tecnologia poderá ser aprimorada para aumentar sua taxa de sucesso e ser testada em outros robôs ou em uma gama mais ampla de cenários.
Detalhes da publicação
Guangyan Chen et al. Robots Acquire Manipulation Skills in Seconds from a Single Human Video, arXiv (2026). DOI: 10.48550/arxiv.2607.20033
Informações sobre a publicação: arXiv
Fonte: arXiv
Artigo original (em inglês) publicado por Ingrid Fadelli na TechXplore.

SOBRE A AUTORA
Ingrid Fadelli
Jornalista freelancer e entusiasta da ciência, com bacharelado em Psicologia e mestrado em Jornalismo Internacional pela City University of London. Começou a escrever para a Science X em 2018 e seus principais interesses incluem IA, robótica, ciência ambiental, entre outros temas.
NOTA

Visando otimizar a produção, usamos nosso assistente de IA, BLIP, para traduzir este artigo, mas sob supervisão humana para garantir a qualidade exigida pelos padrões editoriais da Sustenare News.
