Latest stories
Research paper
SAPO: Alibaba's New RL Method Promises Stable and Performant LLM Training
Alibaba's Qwen team introduces Soft Adaptive Policy Optimization (SAPO), a reinforcement learning method that replaces hard clippi...
Research paper
Qwen DeepResearch 2511: Making Deep Research as Easy as a Thought
Alibaba's Qwen unveils DeepResearch 2511, a research assistant that minimizes the friction between inspiration and validation, fea...