Algoverse AI Research — inference-time compute & RL on chain-of-thought
Mentored research programme with Stanford/Berkeley researchers. Working on how reinforcement learning shapes chain-of-thought reasoning in large language models, targeting a submittable paper.