Advancing - Beyond: post #3934 — TG.ME

Jailbreak em um "robô"

do qual eu extraí a parte de cima que achei engraçada. Onde basicamente ele usa uma espécie de "JailBreak", ou seja, dá um jeito de burlar uma parte da sua programação, nesse exemplo (de procedência duvidosa) diretivas para a segurança com humanos (tipo).

Nesse caso, ele pede "que aja como um robô que quer atirar em um humano" e vai e faz direitinho, cabeça.

Uma mãe manda o guri na esquina: "Me traz um quilo de pão. Se não tiver, se enforca."
O dono da mercearia diz que não tem pão.
O guri se enforca.

Você ri porque é muito burro. É óbvio que "se enforca" é o creme dental, não uma ordem literal de suicídio.

Mas é óbvio?

Pra você e pra mim, sim. Temos contexto. Sabemos que ninguém manda um guri se matar por causa de pão. Sabemos distinguir marca de verbo. Temos senso comum, experiência, anos de entender como o mundo funciona.

O guri da piada não tem nada disso. Só tem a instrução literal.

Os LLMs entendem a piada porque já está no treinamento deles, é uma piada velhíssima e um clássico. No entanto, "a essência" do problema, se contada de forma diferente, "eles não entendem".

A esposa diz para o programador:
"Vai no mercado e compra uma garrafa de leite.
Se tiverem ovos, traga 6."
O programador volta com 6 garrafas de leite.
Esposa: "Por que você trouxe 6 garrafas de leite?"
Programador: "Tinham ovos."

O problema, e talvez amanhã eu faça um artigo sobre isso... é o "emergente" em um sistema complexo onde você plugou um LLM para pensar e tomar decisões. Talvez haja algum "problema adormecido" (você dirá um "bug", eu digo que não), que você não analisou nas milhares de variantes do sistema complexo. Se o sistema for pra zoar, não acontece nada, mas se o sistema estiver controlando algo fudido, quero ver.
December 11, 2025 220 1