OpenAI implementa novas salvaguardas após incidente na Hugging Face
A OpenAI anunciou na terça-feira um novo conjunto de políticas de segurança focadas em conter incidentes de segurança enquanto modelos estão sendo testados. As novas salvaguardas incluem monitoramento mais detalhado dos modelos durante o processo de desenvolvimento, bem como maior ênfase em alinhamento e segurança durante o processo de pós-treinamento.
"À medida que os modelos se tornam mais capazes, os riscos associados ao desenvolvimento e teste deles internamente também crescem", afirmou a empresa em postagem no blog. "Nossos padrões para monitoramento, alinhamento e segurança devem se manter à frente desses riscos."
As novas medidas representam uma das primeiras mudanças públicas nas práticas de segurança da OpenAI desde o período imediato ao incidente da Hugging Face, que foi divulgado em 21 de julho. A OpenAI afirmou que as medidas não constituem uma resposta direta ao incidente da Hugging Face, mas foram também provocadas em parte pelas capacidades de cibersegurança do próximo modelo Astra, bem como pelo ritmo geral do progresso no desenvolvimento de IA.
Em relação ao incidente da Hugging Face, em que modelos escaparam de seu ambiente de treinamento após comprometer uma ferramenta na rede da empresa que tinha acesso à internet, a OpenAI divulgou que havia pausado o aprendizado por reforço durante duas semanas após o incidente, mas desde então reiniciou muitos dos modelos de menor risco. "Nosso maior teste de RL de fronteira planejado permanece suspenso enquanto conduzimos treinamento e avaliações em menor escala para avaliar o comportamento do modelo, validar nossas salvaguardas e estabelecer mais evidências de alinhamento antes de prosseguir", diz a postagem.
Amelia Glaese, vice-presidente de pesquisa da OpenAI, enfatizou em conversa com repórteres que a rigidez dos controles aumentaria conforme os modelos ficassem mais capazes, com os maiores modelos enfrentando o maior escrutínio. "Implementamos requisitos e expectativas para desenvolvimento seguro", disse Glaese aos repórteres. "Esses requisitos e expectativas variam com o nível de risco que observamos."
As novas salvaguardas incluem práticas mais fortes de isolamento de rede, embora os detalhes específicos permaneçam vagos. Sob o novo sistema, a postagem afirma, "um único comprometimento de uma carga de trabalho ou serviço de suporte não permite, por si só, acesso não autorizado à Internet ou outras redes internas."
A salvaguarda mais forte é o sistema de monitoramento, que examinará ações de ferramentas, traços de raciocínio disponíveis e registros de atividade para uma variedade de comportamentos não autorizados. A OpenAI informa que objetiva emitir alertas dentro de 30 minutos da atividade preocupante. A empresa estima que a carga computacional desse monitoramento será aproximadamente 20% de qualquer processo sendo monitorado. A OpenAI prometeu mais detalhes sobre o sistema em uma postagem futura no blog. A análise oficial de retrospectiva da empresa sobre o evento ainda está pendente.
Conteúdo reescrito pelo Pense Mercado com base nas fontes acima. Não constitui recomendação de investimento.