Categorias
Tecnologia

O novo modelo Sora da OpenAI pode gerar vídeos de um minuto a partir de prompts de texto

[ad_1]

A OpenAI anunciou na quinta-feira o Sora, um novo modelo que gera vídeos de alta definição com até um minuto de duração a partir de prompts de texto. Sora, que significa “céu” em japonês, não estará disponível ao público em geral tão cedo. Em vez disso, a OpenAI está a disponibilizá-lo a um pequeno grupo de académicos e investigadores que avaliarão os danos e o seu potencial de utilização indevida.

“Sora é capaz de gerar cenas complexas com vários personagens, tipos específicos de movimento e detalhes precisos do assunto e do plano de fundo”, afirmou a empresa. em seu site. “O modelo entende não apenas o que o usuário pediu no prompt, mas também como essas coisas existem no mundo físico.”

Um dos vídeos gerados por Sora que a OpenAI compartilhou em seu site mostra um casal caminhando por uma cidade nevada de Tóquio enquanto pétalas de flores de cerejeira e flocos de neve sopram ao seu redor.

Outro mostra mamutes peludos de aparência realista caminhando por uma campina nevada em um cenário de cadeias de montanhas cobertas de neve.

A OpenAI afirma que o modelo funciona como resultado de uma “compreensão profunda da linguagem”, o que permite interpretar os prompts de texto com precisão. Ainda assim, como basicamente todos os geradores de imagens e vídeos de IA que vimos, Sora não é perfeito. Num dos exemplos, o prompt, que pede um vídeo de um dálmata olhando através de uma janela e pessoas “caminhando e andando de bicicleta pelas ruas do canal”, omite inteiramente as pessoas e as ruas no vídeo. A OpenAI também alerta que o modelo pode ter dificuldade para entender causa e efeito – pode gerar um vídeo de uma pessoa comendo um biscoito, por exemplo, mas o biscoito pode não ter marcas de mordida.

Sora não é o primeiro modelo de texto para vídeo que existe. Outras empresas incluindo meta, Google e Pista, provocaram ferramentas de conversão de texto em vídeo ou as disponibilizaram ao público. Ainda assim, nenhuma outra ferramenta é capaz de gerar vídeos com até 60 segundos. Sora também gera vídeos inteiros de uma só vez, em vez de juntá-los quadro a quadro como outros modelos, o que garante que os assuntos do vídeo permaneçam os mesmos mesmo quando ficam temporariamente fora de vista.

A ascensão das ferramentas de conversão de texto em vídeo despertou preocupações sobre seu potencial para criar mais facilmente imagens falsas de aparência realista. “Estou absolutamente aterrorizado que este tipo de coisa influencie uma eleição disputada por pouco”, disse Oren Etzioni, professor da Universidade de Washington especializado em inteligência artificial e fundador da True Media, uma organização que trabalha para identificar desinformação em políticas políticas. campanhas, contado O jornal New York Times. E a IA generativa de forma mais ampla desencadeou retaliação de artistas e profissionais criativos preocupados com a tecnologia usada para substituir empregos.

OpenAI disse que estava trabalhando com especialistas em áreas como desinformação, conteúdo de ódio e preconceito para testar a ferramenta antes de disponibilizá-la ao público. A empresa também está construindo ferramentas capazes de detectar vídeos gerados pelo Sora e incluir metadados nos vídeos gerados para facilitar a detecção. A empresa recusou para contar ao Tempos como Sora foi treinado, exceto afirmando que utilizou tanto “vídeos disponíveis publicamente” quanto vídeos licenciados por detentores de direitos autorais.



[ad_2]

Fonte:

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *