[ad_1]
Na quinta-feira, o Google revelado Gemini 1.5 Pro, que a empresa descreve como oferecendo “desempenho dramaticamente melhorado” em relação ao modelo anterior. A trajetória de IA da empresa – vista internamente como cada vez mais crítico para o seu futuro – segue o lançamento do Gemini 1.0 Ultra na semana passada, juntamente com a mudança de marca do chatbot Bard (para Gemini) para se alinhar com os recursos mais poderosos e versáteis do novo modelo.
Em uma postagem de anúncio no blog, o CEO do Google, Sundar Pichai, e o CEO do Google DeepMind, Demis Hassabis, tentam equilibrar a garantia ao seu público sobre a segurança ética da IA, ao mesmo tempo em que promovem as capacidades de rápido avanço de seus modelos. “Nossas equipes continuam expandindo as fronteiras de nossos modelos mais recentes com a segurança em primeiro lugar”, resumiu Pichai.
A empresa precisa enfatizar a segurança dos céticos da IA (incluindo um ex-CEO do Google) e reguladores governamentais. Mas também precisa enfatizar o desempenho acelerado de seus modelos para desenvolvedores de IA, potenciais clientes e investidores preocupados com o fato de a empresa ter sido muito lenta para reagir às O grande sucesso da OpenAI com Bate-papoGPT.
Pichai e Hassabis dizem que o Gemini 1.5 Pro oferece resultados comparáveis ao Gemini 1.0 Ultra. No entanto, o Gemini 1.5 tem um desempenho mais eficiente nesse nível, com requisitos computacionais reduzidos. Os recursos multimodais incluem processamento de texto, imagens, vídeos, áudio ou código. À medida que os modelos de IA avançam, eles continuarão a oferecer uma gama mais versátil de recursos em uma caixa de prompt (outro exemplo recente foi OpenAI integrando geração de imagens DALL-E 3 no ChatGPT).
O Gemini 1.5 Pro também pode lidar com até um milhão de tokens, ou as unidades de dados que os modelos de IA podem processar em uma única solicitação. O Google afirma que o Gemini 1.5 Pro pode processar mais de 700.000 palavras, uma hora de vídeo, 11 horas de áudio e bases de código com mais de 30.000 linhas de código. A empresa diz que até “testou com sucesso” uma versão que suporta até 10 milhões de tokens.
A empresa afirma que o Gemini 1.5 Pro mantém alta precisão em consultas com contagens de tokens maiores quando tem mais dados novos para aprender. Diz que o modelo impressionou no Avaliação Agulha no Palheiro. Neste teste, os desenvolvedores inserem uma pequena informação dentro de um longo bloco de texto para ver se o modelo de IA consegue identificá-la. O Google disse que o Gemini 1.5 Pro pode encontrar o texto incorporado 99% do tempo em blocos de dados de até um milhão de tokens.
O Google diz que o Gemini 1.5 Pro pode raciocinar sobre vários detalhes das transcrições da missão lunar Apollo 11 de 402 páginas. Além disso, ele pode analisar pontos da trama e eventos de um filme mudo de 44 minutos estrelado por Buster Keaton. “Como a longa janela de contexto do 1.5 Pro é a primeira do tipo entre modelos de grande escala, estamos continuamente desenvolvendo novas avaliações e benchmarks para testar suas novas capacidades”, escreveu Hassabis.
O Google está lançando o Gemini 1.5 Pro com capacidade de 128.000 tokens, o mesmo número em que os modelos GPT-4 da OpenAI (anunciados publicamente) atingem o máximo. Hassabis diz que o Google eventualmente introduzirá novos níveis de preços que suportam consultas de até um milhão de tokens.
O Gemini 1.5 Pro também é adepto do aprendizado de novas habilidades a partir de informações em prompts longos — sem ajustes adicionais (“aprendizado em contexto”). Em um benchmark chamado Tradução automática de um livro, o modelo aprendeu um manual de gramática para Kalamang, um idioma com menos de 200 falantes em todo o mundo e no qual não havia sido treinado anteriormente. A empresa afirma que o Gemini 1.5 Pro aprendeu a ter um desempenho semelhante ao de um ser humano aprendendo o mesmo conteúdo ao traduzir do inglês para Kalamang.
Em um anúncio que chamará a atenção dos desenvolvedores, o Google afirma que o Gemini 1.5 Pro pode realizar tarefas de resolução de problemas em blocos de código mais longos. “Quando recebe um prompt com mais de 100.000 linhas de código, ele pode raciocinar melhor entre exemplos, sugerir modificações úteis e fornecer explicações sobre como funcionam diferentes partes do código”, escreveu Hassabis.
No que diz respeito à ética e à segurança, o Google afirma que está adotando “a mesma abordagem de implantação responsável” que adotou com os modelos Gemini 1.0. Isso inclui o desenvolvimento e a aplicação de técnicas de red-teaming, onde um grupo de desenvolvedores éticos serve essencialmente como advogado do diabo, testando “uma série de danos potenciais”. Além disso, a empresa afirma que examina minuciosamente áreas como segurança de conteúdo e danos representacionais. A empresa afirma que continua a desenvolver novos testes éticos e de segurança para as suas ferramentas de IA.
O Google está lançando o Gemini 1.5 com acesso antecipado para desenvolvedores e clientes corporativos. A empresa planeja torná-lo mais amplamente disponível eventualmente. Gemini 1.0 está atualmente disponível para consumidores, junto com um Variante profissional isso custa $ 20 mensais.
[ad_2]
Fonte:
