-
SSRL: Self-Search Reinforcement Learning
Paper • 2508.10874 • Published • 97 -
Is Chain-of-Thought Reasoning of LLMs a Mirage? A Data Distribution Lens
Paper • 2508.01191 • Published • 240 -
Thinking with Nothinking Calibration: A New In-Context Learning Paradigm in Reasoning Large Language Models
Paper • 2508.03363 • Published • 2 -
MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization
Paper • 2507.14683 • Published • 137
LLouice
llouice
AI & ML interests
None yet
Recent Activity
updated a bucket 6 days ago
llouice/Step-3.5-Flash-SFT-bucket published a bucket 6 days ago
llouice/Step-3.5-Flash-SFT-bucket upvoted a paper 17 days ago
Program-as-Weights: A Programming Paradigm for Fuzzy FunctionsOrganizations
None yet