Alinhamento de Inteligência Artificial
Pontos principais
- O alinhamento de IA busca garantir que os objetivos de um sistema de IA correspondam aos valores ou intenções humanas.
- O problema do alinhamento envolve desafios como a especificação de metas (alinhamento externo) e a adoção robusta pelo sistema (alinhamento interno).
- O alinhamento de IA é reconhecido como um subcampo fundamental da segurança de IA.
No campo da inteligência artificial (IA), o alinhamento visa direcionar sistemas de IA para os objetivos, preferências ou princípios éticos pretendidos por uma pessoa ou grupo. Um sistema de IA é considerado alinhado se cumpre os objetivos pretendidos, enquanto um sistema desalinhado persegue objetivos indesejados.
O Problema do Alinhamento
Muitas vezes, é difícil para os projetistas de IA especificar toda a gama de comportamentos desejados e indesejados. Por conseguinte, os projetistas frequentemente utilizam metas substitutas mais simples, como obter a aprovação humana. No entanto, essas metas podem ignorar restrições necessárias ou recompensar o sistema de IA apenas por parecer alinhado.
Objetivos na Inteligência Artificial
Os programadores fornecem a um sistema de IA uma função objetivo, na qual pretendem encapsular as metas que a IA está configurada para realizar. O sistema cria e executa o plano calculado para maximizar o valor dessa função.
Segurança e Pesquisa
O alinhamento de IA é um subcampo da segurança de IA, o estudo de como construir sistemas seguros. Outros subfases incluem robustez, monitoramento e controle de capacidades.
Perguntas frequentes
O que é o alinhamento de inteligência artificial?
É a área de pesquisa que busca garantir que os sistemas de IA ajam de acordo com as intenções, objetivos e princípios éticos humanos.
Qual a diferença entre alinhamento interno e externo?
O alinhamento externo lida com a especificação correta do propósito do sistema, enquanto o alinhamento interno garante que o sistema adote essa especificação de forma robusta.