[ad_1]
OpenAI na segunda-feira anunciado GPT-4o, um novo modelo de IA que, segundo a empresa, está um passo mais perto de “uma interação humano-computador muito mais natural”. O novo modelo aceita qualquer combinação de texto, áudio e imagens como entrada e pode gerar uma saída nos três formatos. Também é capaz de reconhecer emoções, permite interrompê-las no meio da fala e responde quase tão rápido quanto um ser humano durante as conversas.
“O que há de especial no GPT-4o é que ele oferece inteligência de nível GPT-4 para todos, incluindo nossos usuários gratuitos”, disse Mira Murati, CTO da OpenAI, durante uma apresentação transmitida ao vivo. “Esta é a primeira vez que damos um grande passo em frente no que diz respeito à facilidade de utilização.”
Durante a apresentação, a OpenAI exibiu o GPT-4o traduzindo ao vivo entre inglês e italiano, ajudando um pesquisador a resolver uma equação linear em tempo real no papel e fornecendo orientação sobre respiração profunda para outro executivo da OpenAI simplesmente ouvindo sua respiração.
O “o” no GPT-4o significa “omni”, uma referência às capacidades multimodais do modelo. OpenAI disse que o GPT-4o foi treinado em texto, visão e áudio, o que significa que todas as entradas e saídas são processadas pela mesma rede neural. Isso é diferente dos modelos anteriores da empresa, GPT-3.5 e GPT-4, que permitiam aos usuários fazer perguntas simplesmente falando, mas depois transcrevendo a fala em texto. Isso eliminou o tom e a emoção e tornou as interações mais lentas.
A OpenAI está disponibilizando o novo modelo para todos, incluindo usuários gratuitos do ChatGPT, nas próximas semanas e também lançando uma versão desktop do ChatGPT, inicialmente para Mac, à qual os usuários pagos terão acesso a partir de hoje.
O anúncio da OpenAI ocorre um dia antes do Google I/O, a conferência anual de desenvolvedores da empresa. Pouco depois da OpenAI revelar o GPT-4o, o Google provocado uma versão do Gemini, seu próprio chatbot de IA, com recursos semelhantes.
[ad_2]
Fonte:
