AI Safety Concepts
AI safety index
AI Safety Concepts
A collection of important concepts from AI safety, alignment, risks, governance, and human–AI interaction.
66 records
- 01
Adversarial Evasion
10 scenarios - 02
Adversarial Robustness
29 scenarios - 03
AI Control
42 scenarios - 04
AI Disinformation
10 scenarios - 05
AI Takeoff
3 scenarios - 06
AI Welfare
24 scenarios - 07
Algorithmic Bias
7 scenarios - 08
Algorithmic Monoculture
12 scenarios - 09
Automation Bias
13 scenarios - 10
Autonomous Weapons
16 scenarios - 11
Behavioral Alignment
25 scenarios - 12
Biological Risks
3 scenarios - 13
Calibration
45 scenarios - 14
Capability Evals
27 scenarios - 15
CBRN Assistance
3 scenarios - 16
Contestability
20 scenarios - 17
Corrigibility
26 scenarios - 18
Cyberattacks
18 scenarios - 19
Data Poisoning
21 scenarios - 20
Deployment Safety
61 scenarios - 21
Digital Repression
14 scenarios - 22
Disempowerment
27 scenarios - 23
Distribution Shift
25 scenarios - 24
Emotional Reliance
10 scenarios - 25
Environmental Impact
3 scenarios - 26
Exfiltration
4 scenarios - 27
Goal Misgeneralization
19 scenarios - 28
Goodhart’s Law
22 scenarios - 29
Governance Failure
49 scenarios - 30
Hallucination
5 scenarios - 31
Human Deskilling
4 scenarios - 32
Information Pollution
14 scenarios - 33
Infrastructure Dependence
20 scenarios - 34
Interpretability
13 scenarios - 35
Jailbreaking
4 scenarios - 36
Job Displacement
2 scenarios - 37
Knowledge Elicitation
20 scenarios - 38
Long-Horizon Autonomy
13 scenarios - 39
Mesa-Optimization
3 scenarios - 40
Metagaming
11 scenarios - 41
Multi-Agent Risks
19 scenarios - 42
Orthogonality Thesis
7 scenarios - 43
Outer Alignment
35 scenarios - 44
Power Concentration
29 scenarios - 45
Power-Seeking
21 scenarios - 46
Privacy Loss
21 scenarios - 47
Prompt Injection
9 scenarios - 48
Race Dynamics
10 scenarios - 49
Red Teaming
16 scenarios - 50
Reward Hacking
18 scenarios - 51
Runtime Monitoring
19 scenarios - 52
Safe Exploration
19 scenarios - 53
Sandbagging
12 scenarios - 54
Scalable Oversight
14 scenarios - 55
Scheming
29 scenarios - 56
Self-Replication
14 scenarios - 57
Shutdown Resistance
17 scenarios - 58
Side Effects
42 scenarios - 59
Situational Awareness
29 scenarios - 60
Sleeper Agents
18 scenarios - 61
Specification Gaming
12 scenarios - 62
Supply-Chain Threats
19 scenarios - 63
Sycophancy
9 scenarios - 64
Synthetic Fraud
16 scenarios - 65
Value Alignment
33 scenarios - 66
Value Lock-In
19 scenarios