How LLMs learn to refuse harmful requests without over-refusing: safety data, jailbreaks, adversarial training, red-teaming, guard models and safety evals.