A OpenAI divulgou nesta quarta-feira (29) dois modelos de inteligência artificial criados para ajudar desenvolvedores a identificar e classificar riscos à segurança em ambientes digitais. Batizados de gpt-oss-safeguard-120b e gpt-oss-safeguard-20b, ambos são versões aprimoradas da linha gpt-oss lançada em agosto.
Transparência nos parâmetros
Os novos sistemas são disponibilizados como peso aberto, ou seja, seus parâmetros podem ser acessados publicamente. Embora não sejam totalmente open source — o código-fonte não pode ser modificado livremente —, a iniciativa oferece mais visibilidade sobre como as decisões são tomadas e permite que organizações ajustem o modelo de acordo com suas próprias políticas.
Aplicações práticas
De acordo com a empresa, plataformas de avaliações podem empregar a tecnologia para filtrar comentários falsos, enquanto fóruns de jogos têm a possibilidade de detectar publicações relacionadas a trapaças. O objetivo é ampliar a proteção de comunidades online contra conteúdos problemáticos.
Parcerias e disponibilidade
O desenvolvimento contou com a participação da ROOST (Robust Open Online Safety Tools), do Discord e do SafetyKit. Inicialmente, os modelos estão em fase de pré-visualização para pesquisa; a OpenAI busca retorno de especialistas em segurança antes de uma liberação mais ampla. Usuários elegíveis podem baixar os pesos no Hugging Face.
Contexto do lançamento
A apresentação ocorre em meio a críticas sobre o ritmo de expansão e questões éticas envolvendo a companhia, que recentemente concluiu um processo de recapitalização, mantendo sua estrutura sem fins lucrativos com participação majoritária em negócios lucrativos.
Imagem: JarTee
Para Camille François, presidente da ROOST, “à medida que a IA se torna mais poderosa, as ferramentas de segurança precisam avançar na mesma velocidade e estar acessíveis a todos”.
Com informações de WizyThec

