OpenAI lança webcrawler GPTBot e instruções sobre como bloqueá-lo
A OpenAI lançou um rastreador da web para melhorar modelos de inteligência artificial como o GPT-4.
Chamado GPTBot, o sistema vasculha a Internet para treinar e aprimorar as capacidades da IA. O uso do GPTBot tem o potencial de melhorar os modelos de IA existentes no que diz respeito a aspectos como precisão e segurança, de acordo com uma postagem no blog da OpenAI.
“As páginas da Web rastreadas com o agente de usuário GPTBot podem ser potencialmente usadas para melhorar modelos futuros e são filtradas para remover fontes que exigem acesso pago, são conhecidas por coletar informações de identificação pessoal (PII) ou contêm texto que viola nossas políticas”, diz o publicar.
No entanto, os sites podem optar por restringir o acesso ao rastreador da web e impedir que o GPTBot acesse seus sites, seja parcialmente ou optando por sair totalmente. A OpenAI disse que os operadores de sites podem proibir o rastreador bloqueando seu endereço IP ou no arquivo Robots.txt de um site.
Anteriormente, a OpenAI caiu em maus lençóis pela forma como coleta dados e por coisas como violação de direitos autorais e violações de privacidade. Em junho passado, a plataforma de IA foi processada por “roubar” dados pessoais para treinar o ChatGPT.
Suas funções de cancelamento foram implementadas apenas recentemente, com recursos como a desativação do histórico de bate-papo, permitindo aos usuários mais controle sobre quais dados pessoais podem ser acessados.
ChatGPT 3.5 e 4 foram treinados em dados e textos online até setembro de 2021. Atualmente não há como remover conteúdo desse conjunto de dados.
De acordo com a OpenAI, você pode proibir o GPTBot adicionando-o ao Robots.txt do seu site, que é essencialmente um arquivo de texto que instrui os rastreadores da web sobre o que eles podem ou não acessar em um site.
Você também pode personalizar quais partes um rastreador da web pode usar, permitindo certas páginas e proibindo outras.
TópicosInteligência ArtificialChatGPT
