[ad_1]
Tumblr e WordPress estão supostamente prontos para fechar acordos para vender dados de usuários para empresas de inteligência artificial OpenAI e Midjourney. 404 Mídia relatórios que a controladora das plataformas, Automattic, está em fase de conclusão de um acordo para fornecer dados para ajudar a treinar os modelos das empresas de IA.
Não está claro quais dados serão incluídos, mas o relatório sugere que a Automattic pode ter exagerado inicialmente. Uma suposta postagem interna do gerente de produto do Tumblr, Cyle Gage, sugere que a Automattic se preparou para enviar dados privados ou relacionados a parceiros que não deveriam ser incluídos no acordo. O conteúdo questionável supostamente incluía postagens privadas em blogs públicos, blogs excluídos ou suspensos, perguntas não respondidas (portanto, não postadas publicamente), respostas privadas, postagens marcadas como explícitas e conteúdo de blogs de parceiros premium (como o antigo site de música da Apple).
A postagem interna sugere que os engenheiros da Automattic estão preparando uma lista de IDs de postagem que deveriam ter sido excluídos. Não está claro se os dados já foram enviados às empresas de IA.
O Engadget enviou um e-mail à Automattic para pedir comentários sobre o relatório. A empresa respondeu com um declaração publicada, alegando: “Compartilharemos apenas conteúdo público hospedado no WordPress.com e no Tumblr de sites que não optaram por sair”. A declaração observa que as regulamentações legais atualmente não exigem que os rastreadores da web das empresas de IA cumpram as preferências de exclusão dos usuários.
A linha final da declaração da Automattic parece estar alinhada com os negócios relatados. “Também estamos trabalhando diretamente com empresas selecionadas de IA, desde que seus planos estejam alinhados com o que interessa à nossa comunidade: atribuição, cancelamento e controle”, escreveu Automattic. “Nossas parcerias respeitarão todas as configurações de opt-out. Também planejamos dar um passo adiante e atualizar regularmente todos os parceiros sobre pessoas que recentemente optaram por sair e pedir que seu conteúdo seja removido de fontes anteriores e de treinamentos futuros.”
A empresa supostamente planeja lançar uma nova ferramenta de exclusão na quarta-feira que afirma permitir que os usuários bloqueiem o treinamento de terceiros – incluindo empresas de IA – em seus dados. 404 Mídia revisou um suposto FAQ interno que a Automattic preparou para a ferramenta, que inclui a resposta: “Se você cancelar desde o início, bloquearemos o acesso de rastreadores ao seu conteúdo, adicionando seu site a uma lista de não permitidos. Se você mudar de ideia mais tarde, também planejamos atualizar todos os parceiros sobre as pessoas que cancelaram recentemente e pedir que seu conteúdo seja removido de fontes anteriores e de treinamentos futuros.”
A frase, descrevendo-a como “pedir” às empresas de IA que removam os dados, pode ser relevante.
Um suposto documento interno do chefe de IA da Automattic, Andrew Spittle, respondendo a uma pergunta da equipe sobre garantias de remoção de dados ao usar a ferramenta, explica: “Notificaremos regularmente os parceiros existentes sobre qualquer pessoa que tenha optado por não participar desde a última vez que fornecemos uma lista. Quero que este seja um processo contínuo em que defendemos regularmente a exclusão de conteúdos anteriores com base nas preferências atuais. Pediremos que o conteúdo seja excluído e removido de quaisquer treinamentos futuros. Acredito que os parceiros honrarão isso com base em nossas conversas com eles até o momento. Não creio que eles ganhem muito ao mantê-lo.”
Portanto, se um usuário do Tumblr ou WordPress solicitar a exclusão do treinamento de IA, a Automattic irá supostamente “pedir” e “defender” sua remoção. E o chefe de IA da empresa “acredita” que as empresas de IA considerarão que é do seu interesse cumprir “com base em nossas conversas”. (Que tal isso para ter certeza!)
Os acordos de treinamento de dados de IA se tornaram uma oportunidade lucrativa para sites que estão pisando na água nos dias de hoje cenário escorregadio de publicação on-line. (A equipe do Tumblr teria sido reduzido a uma tripulação esquelética no final de 2023.) Na semana passada, o Google fechou um acordo com o Reddit (antes do IPO deste último) para treinar na vasta base de conhecimento da plataforma de conteúdo criado pelo usuário. Enquanto isso, a OpenAI lançou um programa de parceria no ano passado para coletar conjuntos de dados de terceiros para ajudar a treinar seus modelos de IA.
Atualização, 27 de fevereiro de 2024, 15h56 horário do leste dos EUA: Esta história foi atualizada para adicionar uma declaração publicada pela Automattic, empresa controladora do WordPress e do Tumblr.
[ad_2]
Fonte:
