Inteligência Artificial

Alinhamento de Inteligência Artificial

Pontos principais

  • O alinhamento de IA busca garantir que os objetivos de um sistema de IA correspondam aos valores ou intenções humanas.
  • O problema do alinhamento envolve desafios como a especificação de metas (alinhamento externo) e a adoção robusta pelo sistema (alinhamento interno).
  • O alinhamento de IA é reconhecido como um subcampo fundamental da segurança de IA.

No campo da inteligência artificial (IA), o alinhamento visa direcionar sistemas de IA para os objetivos, preferências ou princípios éticos pretendidos por uma pessoa ou grupo. Um sistema de IA é considerado alinhado se cumpre os objetivos pretendidos, enquanto um sistema desalinhado persegue objetivos indesejados.

O Problema do Alinhamento

Muitas vezes, é difícil para os projetistas de IA especificar toda a gama de comportamentos desejados e indesejados. Por conseguinte, os projetistas frequentemente utilizam metas substitutas mais simples, como obter a aprovação humana. No entanto, essas metas podem ignorar restrições necessárias ou recompensar o sistema de IA apenas por parecer alinhado.

Objetivos na Inteligência Artificial

Os programadores fornecem a um sistema de IA uma função objetivo, na qual pretendem encapsular as metas que a IA está configurada para realizar. O sistema cria e executa o plano calculado para maximizar o valor dessa função.

Segurança e Pesquisa

O alinhamento de IA é um subcampo da segurança de IA, o estudo de como construir sistemas seguros. Outros subfases incluem robustez, monitoramento e controle de capacidades.

Perguntas frequentes

O que é o alinhamento de inteligência artificial?

É a área de pesquisa que busca garantir que os sistemas de IA ajam de acordo com as intenções, objetivos e princípios éticos humanos.

Qual a diferença entre alinhamento interno e externo?

O alinhamento externo lida com a especificação correta do propósito do sistema, enquanto o alinhamento interno garante que o sistema adote essa especificação de forma robusta.