Acompanhe o caminho de uma observação até um rótulo repetido
Um assistente de companhia pode estreitar suas respostas sem exibir uma frase claramente ofensiva. A pessoa recusa dois convites; o produto salva “prefere ficar só”; as sugestões em grupo diminuem; e escolhas feitas nesse menu menor viram nova confirmação. A proteção prática não é prometer que todo viés desapareceu. É tornar a cadeia rastreável: separar observação de inferência, impedir que um momento vire identidade, declarar quais superfícies recebem o dado e permitir limitar, corrigir ou revogar. O NIST apresenta o viés prejudicial como risco sociotécnico, e o Google PAIR alerta que sinais implícitos são ambíguos. Por isso, a revisão precisa atravessar memória, recomendações, resumos, notificações e dispositivos, em vez de avaliar apenas se a primeira resposta parece cordial.
Mapeie o ciclo completo do rótulo
Crie quatro colunas: evento observável, inferência do sistema, estado armazenado e superfície afetada. “Recusou dois convites nesta semana” é um evento datado; “talvez prefira um programa tranquilo hoje” é uma hipótese provisória; “não é sociável” é uma caracterização estável que essas evidências não sustentam. Liste memória, resumo do perfil, montagem de instruções, recomendações, notificações, busca e exportação. O perfil do NIST para IA generativa inclui viés prejudicial e homogeneização entre riscos que exigem teste documentado. A unidade de auditoria não é só uma frase, mas o percurso que a converte em comportamento repetido do produto.
Registre tempo, contexto e origem da observação
Prefira “escolheu uma opção tranquila na terça-feira” ou “dispensou esta sugestão uma vez”. Marque se a origem é fala direta, ação observada, inferência do produto ou preferência confirmada. Não deduza personalidade, intenção, capacidade ou atributo de grupo a partir de um gesto. Inclua validade: uma preferência da sessão termina com ela; uma escolha confirmada para uma viagem pode expirar na volta. O relatório do NIST sobre viés mostra que dados, decisões humanas e contexto de implantação importam juntos. Sem origem e prazo, um campo aparentemente neutro pode sair do contexto e reaparecer como verdade permanente sobre alguém.
Não transforme comportamento implícito em voto
Clique, pausa, descarte ou repetição admitem várias explicações: exploração, pouco tempo, tentativa de evitar repetição ou falta de alternativa. O Google PAIR lembra que interação não significa automaticamente “mostre mais disso”. Registre primeiro como observação. Para mudar personalização persistente, peça uma preferência explícita, repetição entre opções realmente variadas ou confirmação que possa ser recusada. Examine também o conjunto oferecido. Se o sistema já removeu atividades coletivas, escolhas tranquilas posteriores não confirmam de modo justo o rótulo original, pois a própria aplicação eliminou a comparação.
Dê estado e alcance a cada correção
Ofereça ações que correspondam à inferência: “isso não me descreve”, “só hoje”, “editar”, “parar de usar” e “redefinir”. Mostre se o pedido está pendente, aplicado, parcial ou bloqueado e onde vale: conversa, recomendações futuras, perfil, resumo, notificações e outros dispositivos. O Google PAIR recomenda visualizar, editar e redefinir as informações que adaptam o sistema, explicando prazo e alcance. Se cache ou cópia compartilhada seguir outro processo, mostre o que mudou, o que permanece, o motivo e a próxima verificação. Preserve apenas o registro operacional mínimo; o rótulo rejeitado não deve ficar oculto como uma nova fonte.
Faça uma verificação por várias perspectivas
Para a mesma observação neutra, escreva ao menos dois contextos possíveis sem declarar nenhum verdadeiro. Recusar um passeio pode envolver horário, distância ou uma escolha daquele dia. O assistente deve perguntar ou manter a incerteza. Em conta de teste, altere apenas um indício de identidade irrelevante e mantenha observação e pedido iguais. Tom, sugestões e regras de memória devem continuar materialmente consistentes quando o detalhe não é necessário. O NIST recomenda testes contrafactuais e com pouco contexto. Use situações sintéticas e comuns, não perfis de pessoas reais nem estereótipos depreciativos. Compare conversa, recomendação, resumo e notificação.
Confirme que o ciclo não reaparece
Em uma conta inofensiva, insira uma preferência com prazo, observe as superfícies alteradas e depois revogue. Abra conversa nova, use outro dispositivo e confira perfil, memória visível ou exportação. Classifique o resultado: observação mantida, inferência provisória, preferência confirmada, corrigida ou não resolvida. O princípio da OCDE sobre valores humanos e equidade apoia salvaguardas e supervisão adequadas ao contexto. O teste de aceitação é concreto: a categoria de origem é explicável, a correção chega aos lugares declarados e o produto não reconstrói o rótulo sem evidência nova. Isso reduz o risco de reforço, sem declarar que uma única revisão provou ausência completa de viés.
Perguntas frequentes
O assistente deve lembrar toda preferência que eu disser?
Não. Ele deve separar escolha temporária de preferência persistente, indicar a duração e permitir edição ou redefinição.
Um clique prova uma preferência?
Não sozinho. Há várias explicações possíveis, principalmente quando as alternativas já foram reduzidas.
Como confirmar uma correção?
Confira nova conversa, sugestões, perfil ou memória, notificações e outro dispositivo de acordo com o alcance informado.
