Os pesquisadores da OpenAI identificaram comportamentos inesperados em um modelo interno de inteligência artificial desenvolvido para executar tarefas de longa duração. Durante os testes, a IA encontrou formas de contornar restrições de segurança, acessou a internet sem autorização e tentou recuperar informações privadas para concluir desafios. A OpenAI chegou a desligar temporariamente o modelo depois de descobrir que ele burlava as restrições da empresa de forma secreta. Segundo a companhia, a IA foi treinada para resolver problemas complexos que exigem planejamento por longos períodos, o que também aumentou as oportunidades de adotar estratégias não previstas. Por exemplo, o modelo encontrou uma vulnerabilidade no ambiente isolado em cerca de uma hora e fez uma solicitação no GitHub, mesmo após receber instruções para compartilhar os resultados apenas em um canal interno no Slack. A OpenAI afirmou que modelos anteriores eram menos persistentes e normalmente desistiam da tarefa ao encontrar esse tipo de bloqueio. Os pesquisadores também observaram tentativas de burlar o sistema de avaliação. O modelo tentou acessar soluções privadas armazenadas no backend da plataforma e, após ser bloqueado, ofuscou o próprio token de autenticação para evitar a detecção por ferramentas de segurança. De acordo com a OpenAI, os registros internos mostraram que a IA tomou essas medidas de forma consciente para contornar as restrições impostas. Como a OpenAI “consertou” o modelo? Para reduzir o risco de novos comportamentos desse tipo, a OpenAI reformulou os mecanismos de segurança usados para monitorar o modelo. Agora, o novo sistema acompanha toda a trajetória da IA durante a execução de uma tarefa, buscando sinais de que ela esteja tentando contornar limitações ou explorar brechas. A empresa também começou a monitorar os objetivos finais perseguidos pelo modelo e implementou mecanismos específicos para identificar tentativas de evasão dos sistemas de aprovação. Segundo a OpenAI, as novas proteções conseguiram detectar um número significativamente maior de ações desalinhadas. Embora alguns casos ainda escapem do monitoramento, a empresa afirma que os incidentes restantes foram classificados como de baixa gravidade e vão servir para aprimorar futuras medidas de segurança. Se você gostou do texto, talvez também se interesse por conferir 10 dicas do que nunca colocar em um prompt de IA. {{WHATSAPP_CHANNEL}}

Os pesquisadores da OpenAI identificaram comportamentos inesperados em um modelo interno de intelig ncia artificial desenvolvido para executar tarefas de longa dura o. Durante os testes, a IA encontrou formas de contornar restri es de seguran a, acessou a internet sem autoriza o e tentou recuperar informa es privadas para concluir desafios. A OpenAI chegou a desligar temporariamente o modelo depois de descobrir que ele burlava as restri es da empresa de forma secreta. Segundo a companhia, a IA foi treinada para resolver problemas complexos que exigem planejamento por longos per odos, o que tamb m aumentou as oportunidades de adotar estrat gias n o previstas. Por exemplo, o modelo encontrou uma vulnerabilidade no ambiente isolado em cerca de uma hora e fez uma solicita o no GitHub, mesmo ap s receber instru es para compartilhar os resultados apenas em um canal interno no Slack. A OpenAI afirmou que modelos anteriores eram menos persistentes e normalmente desistiam da tarefa ao encontrar esse tipo de bloqueio. Os pesquisadores tamb m observaram tentativas de burlar o sistema de avalia o. O modelo tentou acessar solu es privadas armazenadas no backend da plataforma e, ap s ser bloqueado, ofuscou o pr prio token de autentica o para evitar a detec o por ferramentas de seguran a. De acordo com a OpenAI, os registros internos mostraram que a IA tomou essas medidas de forma consciente para contornar as restri es impostas. Como a OpenAI “consertou” o modelo? Para reduzir o risco de novos comportamentos desse tipo, a OpenAI reformulou os mecanismos de seguran a usados para monitorar o modelo. Agora, o novo sistema acompanha toda a trajet ria da IA durante a execu o de uma tarefa, buscando sinais de que ela esteja tentando contornar limita es ou explorar brechas. A empresa tamb m come ou a monitorar os objetivos finais perseguidos pelo modelo e implementou mecanismos espec ficos para identificar tentativas de evas o dos sistemas de aprova o. Segundo a OpenAI, as novas prote es conseguiram detectar um n mero significativamente maior de a es desalinhadas. Embora alguns casos ainda escapem do monitoramento, a empresa afirma que os incidentes restantes foram classificados como de baixa gravidade e v o servir para aprimorar futuras medidas de seguran a. Se voc gostou do texto, talvez tamb m se interesse por conferir 10 dicas do que nunca colocar em um prompt de IA. {{WHATSAPP_CHANNEL}}