AI & ML interests
Open RL Environments at Scale
Recent Activity
-
The ultimate guide to multi-harness RL
๐229Train open models with RL inside real agent harnesses
-
Multi-harness RL slides
๐9Watch a talk on training coding agents with RL environments
-
SmolDataEnvs Multi-harness | SETA Whitebox
๐งชAnswer dataset questions and view scoring results
-
SmolDataEnvs Multi-harness | Native OpenCode
๐งชRun OpenCode tasks and view grading results
-
FineEnvs/MiMo-V2.6-RL-harbor-code
RL Environment โข Updated โข 17.8k โข 4 -
FineEnvs/MiMo-V2.6-RL-harbor-cyber
RL Environment โข Updated โข 5.39k โข 2 -
FineEnvs/MiMo-V2.6-RL-harbor-general
RL Environment โข Updated โข 6.51k -
FineEnvs/MiMo-V2.6-RL-harbor-terminal
RL Environment โข Updated โข 8.87k
-
Geoguesser Environment
๐1Interact with a GeoGuessrโstyle environment through custom actions
-
FineEnvs/geoguesser-tasks
RL Environment โข Updated โข 3.65k โข 459 -
FineEnvs/geoguesser-qwen3.5-4b-grpo
Image-Text-to-Text โข Updated โข 47 -
FineEnvs/geoguesser-qwen3.5-4b-grpo-v3
Image-Text-to-Text โข Updated โข 25
-
Nayana Multilingual OCR
๐OpenEnv document OCR, layout and VQA over 22 languages
-
FLEURS Multilingual ASR
๐1OpenEnv speech recognition over 102 FLEURS languages
-
FineEnvs/gemma-4-E4B-it-kannada-ocr-grpo
Image-Text-to-Text โข Updated โข 33 -
FineEnvs/gemma-4-E4B-it-kannada-asr-grpo
Automatic Speech Recognition โข Updated โข 31
-
FineEnvs/watercolour-grpo-hps-only
Reinforcement Learning โข Updated โข 24 โข 1 -
FineEnvs/watercolour-reference-pool
RL Environment โข Updated โข 178 โข 1.85k โข 2 -
FineEnvs/watercolour-rollouts-hps-only
RL Environment โข Updated โข 470 โข 771 -
FineEnvs/watercolour-grpo-judge-led
Reinforcement Learning โข Updated โข 27 โข 1
-
The ultimate guide to RL environments: building and scaling them in the LLM era
๐259Building and scaling RL environments for LLM training
-
RL Environments 101 โ Slides
๐44Explore RL Environments 101 slide presentation
-
How to turn a game into an RL environment
๐71From an idea to a trained 4B, with the dead ends left in
-
The ultimate guide to multi-harness RL
๐229Train open models with RL inside real agent harnesses
-
Nayana Multilingual OCR
๐OpenEnv document OCR, layout and VQA over 22 languages
-
FLEURS Multilingual ASR
๐1OpenEnv speech recognition over 102 FLEURS languages
-
FineEnvs/gemma-4-E4B-it-kannada-ocr-grpo
Image-Text-to-Text โข Updated โข 33 -
FineEnvs/gemma-4-E4B-it-kannada-asr-grpo
Automatic Speech Recognition โข Updated โข 31
-
The ultimate guide to multi-harness RL
๐229Train open models with RL inside real agent harnesses
-
Multi-harness RL slides
๐9Watch a talk on training coding agents with RL environments
-
SmolDataEnvs Multi-harness | SETA Whitebox
๐งชAnswer dataset questions and view scoring results
-
SmolDataEnvs Multi-harness | Native OpenCode
๐งชRun OpenCode tasks and view grading results
-
FineEnvs/MiMo-V2.6-RL-harbor-code
RL Environment โข Updated โข 17.8k โข 4 -
FineEnvs/MiMo-V2.6-RL-harbor-cyber
RL Environment โข Updated โข 5.39k โข 2 -
FineEnvs/MiMo-V2.6-RL-harbor-general
RL Environment โข Updated โข 6.51k -
FineEnvs/MiMo-V2.6-RL-harbor-terminal
RL Environment โข Updated โข 8.87k
-
Geoguesser Environment
๐1Interact with a GeoGuessrโstyle environment through custom actions
-
FineEnvs/geoguesser-tasks
RL Environment โข Updated โข 3.65k โข 459 -
FineEnvs/geoguesser-qwen3.5-4b-grpo
Image-Text-to-Text โข Updated โข 47 -
FineEnvs/geoguesser-qwen3.5-4b-grpo-v3
Image-Text-to-Text โข Updated โข 25
-
FineEnvs/watercolour-grpo-hps-only
Reinforcement Learning โข Updated โข 24 โข 1 -
FineEnvs/watercolour-reference-pool
RL Environment โข Updated โข 178 โข 1.85k โข 2 -
FineEnvs/watercolour-rollouts-hps-only
RL Environment โข Updated โข 470 โข 771 -
FineEnvs/watercolour-grpo-judge-led
Reinforcement Learning โข Updated โข 27 โข 1
-
The ultimate guide to RL environments: building and scaling them in the LLM era
๐259Building and scaling RL environments for LLM training
-
RL Environments 101 โ Slides
๐44Explore RL Environments 101 slide presentation
-
How to turn a game into an RL environment
๐71From an idea to a trained 4B, with the dead ends left in
-
The ultimate guide to multi-harness RL
๐229Train open models with RL inside real agent harnesses