All coverage under this tag.
On September 12, 2024, OpenAI released o1 (codenamed Strawberry), the first model trained via RL to think at length before answering — redefining reasoning.