Phase 18
Ethics Safety Alignment
Build AI that helps humanity. Not optional.
Lessons (30)
- 01Instruction-Following as Alignment Signal
- 02Reward Hacking and Goodhart's Law
- 03The Direct Preference Optimization Family
- 04Sycophancy as RLHF Amplification
- 05Constitutional AI and RLAIF
- 06Mesa-Optimization and Deceptive Alignment
- 07Sleeper Agents — Persistent Deception
- 08In-Context Scheming in Frontier Models
- 09Alignment Faking
- 10AI Control — Safety Despite Subversion
- 11Scalable Oversight and Weak-to-Strong Generalization
- 12Red-Teaming: PAIR and Automated Attacks
- 13Many-Shot Jailbreaking
- 14ASCII Art and Visual Jailbreaks
- 15Indirect Prompt Injection — Production Attack Surface
- 16Red-Team Tooling — Garak, Llama Guard, PyRIT
- 17WMDP and Dual-Use Capability Evaluation
- 18Frontier Safety Frameworks — RSP, PF, FSF
- 19Anthropic's Model Welfare Program
- 20Bias and Representational Harm in LLMs
- 21Fairness Criteria — Group, Individual, Counterfactual
- 22Differential Privacy for LLMs
- 23Watermarking — SynthID, Stable Signature, C2PA
- 24Regulatory Frameworks — EU, US, UK, Korea
- 25EchoLeak and the Emergence of CVEs for AI
- 26Model, System, and Dataset Cards
- 27Data Provenance and Training-Data Governance
- 28Alignment Research Ecosystem — MATS, Redwood, Apollo, METR
- 29Moderation Systems — OpenAI, Perspective, Llama Guard
- 30Dual-Use Risk — Cyber, Bio, Chem, Nuclear Uplift