Bias-only steering vectors from label-free test-time RL (GRPO, majority-vote reward). One repo per benchmark/base model.
-
OLAResearchX/label-free-bias-steering-ai2d-qwen2.5-vl-7b
Reinforcement Learning • Updated -
OLAResearchX/label-free-bias-steering-logicvista-qwen2.5-vl-7b
Reinforcement Learning • Updated -
OLAResearchX/label-free-bias-steering-mathvista-qwen2.5-vl-7b
Reinforcement Learning • Updated -
OLAResearchX/label-free-bias-steering-mmau-qwen2.5-omni-7b
Reinforcement Learning • Updated