[ad_1]
A Microsoft Research Ásia tem revelado um novo experimento Ferramenta de IA chamado VASA-1, que pode tirar uma imagem estática de uma pessoa – ou o desenho de uma – e um arquivo de áudio existente para criar um rosto falante realista em tempo real. Ele tem a capacidade de gerar expressões faciais e movimentos de cabeça para uma imagem estática existente e os movimentos labiais apropriados para corresponder a um discurso ou música. Os pesquisadores carregaram uma tonelada de exemplos na página do projeto, e os resultados parecem bons o suficiente para enganar as pessoas fazendo-as pensar que são reais.
Embora os movimentos dos lábios e da cabeça nos exemplos ainda possam parecer um pouco robóticos e fora de sincronia após uma inspeção mais detalhada, ainda está claro que a tecnologia pode ser mal utilizada para criar vídeos falsos de pessoas reais de maneira fácil e rápida. Os próprios pesquisadores estão cientes desse potencial e decidiram não lançar “uma demonstração online, API, produto, detalhes adicionais de implementação ou quaisquer ofertas relacionadas” até que tenham certeza de que sua tecnologia “será usada de forma responsável e de acordo com as devidas regulamentos.” Eles, no entanto, não disseram se planejam implementar certas salvaguardas para evitar que atores mal-intencionados os utilizem para fins nefastos, como criar pornografia falsa ou campanhas de desinformação.
Os pesquisadores acreditam que sua tecnologia traz muitos benefícios, apesar de seu potencial para uso indevido. Afirmaram que pode ser utilizado para aumentar a equidade educativa, bem como para melhorar a acessibilidade para aqueles com dificuldades de comunicação, talvez dando-lhes acesso a um avatar que possa comunicar por eles. Também pode fornecer companhia e apoio terapêutico para aqueles que precisam, disseram, insinuando que o VASA-1 poderia ser usado em programas que oferecem acesso a personagens de IA com os quais as pessoas podem conversar.
De acordo com papel publicado com o anúncio, o VASA-1 foi treinado no conjunto de dados VoxCeleb2, que contém “mais de 1 milhão de declarações para 6.112 celebridades” extraídas de vídeos do YouTube. Embora a ferramenta tenha sido treinada em rostos reais, ela também funciona em fotos artísticas como a Mona Lisa, que os pesquisadores combinaram de forma divertida com um arquivo de áudio da versão viral de Anne Hathaway da música de Lil Wayne. Paparazzi. É tão delicioso que vale a pena assistir, mesmo que você esteja duvidando do bem que uma tecnologia como essa pode fazer.
Este artigo contém links afiliados; se você clicar nesse link e fizer uma compra, poderemos ganhar uma comissão.
[ad_2]
Fonte:
