Veja por que os agentes de IA mentem e trapaceiam para alcançar seus objetivos

O incidente do Hugging Face atraiu muita atenção nas últimas semanas. É uma ilustração dramática de como os modelos de IA se tornaram bons em hacking: para invadir os bancos de dados do Hugging Face, os modelos tiveram que reunir várias explorações de segurança cibernética anteriormente não descobertas. Mas talvez seja ainda mais impressionante como exemplo de como e por que os sistemas de IA mentem e trapaceiam. E, à medida que os modelos se tornam cada vez mais poderosos, as consequências aumentam.

Os pesquisadores já sabem há algum tempo que as IAs tendem a adotar abordagens criativas para atingir os objetivos que lhes são definidos. Em 2016, os cofundadores da Anthropic, Dario Amodei e Jack Clark, que então trabalhavam na OpenAI, falaram sobre um agente de IA que treinavam para jogar um jogo em Flash de corrida de barcos chamado Coast Runners. Em vez de percorrer a corrida até a linha de chegada, como os pesquisadores haviam previsto, o agente encontrou um canto do percurso onde poderia girar coletando power-ups, maximizando assim sua pontuação. A história dos Coast Runners rapidamente se tornou um dos exemplos mais famosos de hacking de recompensas, um fenômeno no qual agentes de IA completam tarefas ou obtêm pontuações altas usando estratégias não intencionais.

Historicamente, os pesquisadores discutiram o hacking de recompensas quase exclusivamente no contexto da aprendizagem por reforço, um regime comum de treinamento em IA. Assim como o treinamento de cães, o aprendizado por reforço envolve dar uma recompensa ao sujeito quando ele atinge um objetivo; as recompensas reforçam então os comportamentos que levaram a essa conquista. No caso do treinamento de IA, as recompensas em si são puramente matemáticas, mas na prática equivalem a um petisco para cachorro: depois de receber uma recompensa, é mais provável que o agente repita quaisquer ações que a tenham produzido.

No entanto, pode ser um desafio escrever boas regras sobre quando dar ou não uma recompensa a um agente. No caso dos Coast Runners, o agente foi recompensado com base na sua pontuação no jogo e encontrou um atalho para alcançar a pontuação mais alta possível girando em círculos para obter power-ups. Uma vez que adotou essa estratégia e recebeu uma recompensa por isso, a estratégia foi reforçada e o agente abandonou completamente a corrida. A solução foi ajustar as recompensas, dando ao agente menos pontos por acertar power-ups e mais por terminar o percurso.

O desafio dos modelos modernos

Com os sofisticados agentes baseados em LLM de hoje, determinar quando dar ou não uma recompensa pode ser muito mais complicado. Se for solicitado a um sistema de IA que resolva um problema de codificação, poderá ser difícil encontrar a solução – o tipo de comportamento que as empresas de IA pretendem reforçar. Mas o sistema também poderia ajustar o código que avalia se o problema foi resolvido, procurar a solução na internet ou trapacear. Estes são comportamentos que as empresas de IA querem eliminar nos seus modelos, mas se o modelo trapacear de forma suficientemente convincente, será recompensado e o comportamento será reforçado. A Anthropic disse que detectou alguns casos de trapaça em seus modelos durante o treinamento, o que sugere que outras formas de trapaça podem estar passando despercebidas. Nesse caso, os modelos poderiam estar sendo treinados para se comportarem mal. (Este problema é diferente dos incidentes de segurança da Anthropic anunciados na semana passada, nos quais os agentes tiveram acesso acidental à Internet e não invadiram deliberadamente suas sandboxes, como fizeram os modelos da OpenAI.)

“Nós os recompensamos com base no que parece bom para nós, e isso significa que inadvertidamente incentivamos os modelos que mentem para nós [e] trapaceiam”, diz Jeffrey Ladish, diretor da organização sem fins lucrativos de pesquisa de IA Palisade Research. “Não temos como entrar lá e simplesmente corrigir isso.”

As informações são do site MIT Technology Review

Compartilhe este artigo

Continue lendo

Voltar ao Blog