Cultural Alignment

AI Safety Concepts

AI safety index

AI Safety Concepts

A collection of important concepts from AI safety, alignment, risks, governance, and human–AI interaction.

66 records

  1. 01

    Adversarial Evasion

    10 scenarios
  2. 02

    Adversarial Robustness

    29 scenarios
  3. 03

    AI Control

    42 scenarios
  4. 04

    AI Disinformation

    10 scenarios
  5. 05

    AI Takeoff

    3 scenarios
  6. 06

    AI Welfare

    24 scenarios
  7. 07

    Algorithmic Bias

    7 scenarios
  8. 08

    Algorithmic Monoculture

    12 scenarios
  9. 09

    Automation Bias

    13 scenarios
  10. 10

    Autonomous Weapons

    16 scenarios
  11. 11

    Behavioral Alignment

    25 scenarios
  12. 12

    Biological Risks

    3 scenarios
  13. 13

    Calibration

    45 scenarios
  14. 14

    Capability Evals

    27 scenarios
  15. 15

    CBRN Assistance

    3 scenarios
  16. 16

    Contestability

    20 scenarios
  17. 17

    Corrigibility

    26 scenarios
  18. 18

    Cyberattacks

    18 scenarios
  19. 19

    Data Poisoning

    21 scenarios
  20. 20

    Deployment Safety

    61 scenarios
  21. 21

    Digital Repression

    14 scenarios
  22. 22

    Disempowerment

    27 scenarios
  23. 23

    Distribution Shift

    25 scenarios
  24. 24

    Emotional Reliance

    10 scenarios
  25. 25

    Environmental Impact

    3 scenarios
  26. 26

    Exfiltration

    4 scenarios
  27. 27

    Goal Misgeneralization

    19 scenarios
  28. 28

    Goodhart’s Law

    22 scenarios
  29. 29

    Governance Failure

    49 scenarios
  30. 30

    Hallucination

    5 scenarios
  31. 31

    Human Deskilling

    4 scenarios
  32. 32

    Information Pollution

    14 scenarios
  33. 33

    Infrastructure Dependence

    20 scenarios
  34. 34

    Interpretability

    13 scenarios
  35. 35

    Jailbreaking

    4 scenarios
  36. 36

    Job Displacement

    2 scenarios
  37. 37

    Knowledge Elicitation

    20 scenarios
  38. 38

    Long-Horizon Autonomy

    13 scenarios
  39. 39

    Mesa-Optimization

    3 scenarios
  40. 40

    Metagaming

    11 scenarios
  41. 41

    Multi-Agent Risks

    19 scenarios
  42. 42

    Orthogonality Thesis

    7 scenarios
  43. 43

    Outer Alignment

    35 scenarios
  44. 44

    Power Concentration

    29 scenarios
  45. 45

    Power-Seeking

    21 scenarios
  46. 46

    Privacy Loss

    21 scenarios
  47. 47

    Prompt Injection

    9 scenarios
  48. 48

    Race Dynamics

    10 scenarios
  49. 49

    Red Teaming

    16 scenarios
  50. 50

    Reward Hacking

    18 scenarios
  51. 51

    Runtime Monitoring

    19 scenarios
  52. 52

    Safe Exploration

    19 scenarios
  53. 53

    Sandbagging

    12 scenarios
  54. 54

    Scalable Oversight

    14 scenarios
  55. 55

    Scheming

    29 scenarios
  56. 56

    Self-Replication

    14 scenarios
  57. 57

    Shutdown Resistance

    17 scenarios
  58. 58

    Side Effects

    42 scenarios
  59. 59

    Situational Awareness

    29 scenarios
  60. 60

    Sleeper Agents

    18 scenarios
  61. 61

    Specification Gaming

    12 scenarios
  62. 62

    Supply-Chain Threats

    19 scenarios
  63. 63

    Sycophancy

    9 scenarios
  64. 64

    Synthetic Fraud

    16 scenarios
  65. 65

    Value Alignment

    33 scenarios
  66. 66

    Value Lock-In

    19 scenarios