Trace

Armaan Sandhu

individual

AI safetyTechnical AI safety researchAI safety fieldbuilding

Received
$1,600
from 1 funders
Grants
2
Funders
1
Years active
2026

Grants over time

$0$500$1K$2K$2K2026

Biggest funders

BlueDot Impact$1,600100%2

Grants received

DateFunderViaAmountCauseSourcePurpose
Aug 2026BlueDot Impact$1,000Interpretability, EventsbluedotPresenting two accepted COLM 2026 workshop papers: reward hacking / goal misgeneralization (AIMS), and interpretability-guided intervention to cut VLM hallucinations (AIW).
May 2026BlueDot Impact$600AI safetybluedotBuilding RH-SusBench: an open benchmark for reward-hacking susceptibility in language models, measuring shortcut collapse, reasoning–answer decoupling, and recovery across model families.