openbmb/Ultra-FineWeb-L3
Viewer • Updated • 1.06B • 34.3k • 338
Mostly Olmo-3 architecture 10M model with 2:1 SWA:GQA and HoPE embeddings. Trained on 25B tokens of WildAI's human split, Ultra-FineWeb-L3-QA, and UltraData-Math.
| Tasks | Version | Filter | n-shot | Metric | Value | Stderr | ||
|---|---|---|---|---|---|---|---|---|
| arc_challenge | 1 | none | 0 | acc | ↑ | 0.1800 | ± | 0.0112 |
| none | 0 | acc_norm | ↑ | 0.2184 | ± | 0.0121 | ||
| arc_easy | 1 | none | 0 | acc | ↑ | 0.3489 | ± | 0.0098 |
| none | 0 | acc_norm | ↑ | 0.3409 | ± | 0.0097 | ||
| hellaswag | 1 | none | 0 | acc | ↑ | 0.2719 | ± | 0.0044 |
| none | 0 | acc_norm | ↑ | 0.2756 | ± | 0.0045 | ||
| piqa | 1 | none | 0 | acc | ↑ | 0.5881 | ± | 0.0115 |
| none | 0 | acc_norm | ↑ | 0.5713 | ± | 0.0115 |
Category N Raw Normalized
----------------------------------------------------------------------------------------------
elementary_school_math_continuation::addition::grades_1_2::easy 128 20.31% 20.31%
elementary_school_math_continuation::comparison::grades_2_3::medium 44 13.64% 11.36%
elementary_school_math_continuation::comparison_difference::grades_2_3::medium 48 27.08% 27.08%
elementary_school_math_continuation::data::grades_2_3::easy 43 30.23% 27.91%
elementary_school_math_continuation::division::grades_3_4::medium 54 33.33% 33.33%
elementary_school_math_continuation::fractions_counting::grades_3_4::medium 50 16.00% 18.00%
elementary_school_math_continuation::geometry_area::grades_4_5::medium 52 57.69% 59.62%
elementary_school_math_continuation::geometry_perimeter::grades_4_5::medium 45 44.44% 44.44%
elementary_school_math_continuation::measurement::grades_2_3::easy 76 35.53% 35.53%
elementary_school_math_continuation::money::grades_3_4::medium 64 20.31% 20.31%
elementary_school_math_continuation::multiplication::grades_3_4::medium 74 45.95% 45.95%
elementary_school_math_continuation::patterns::grades_3_4::medium 53 28.30% 28.30%
elementary_school_math_continuation::subtraction::grades_1_2::easy 117 29.06% 28.21%
elementary_school_math_continuation::time::grades_2_3::easy 55 100.00% 100.00%
elementary_school_math_continuation::two_step_add_subtract::grades_2_3::medium 46 17.39% 17.39%
elementary_school_math_continuation::two_step_addition::grades_2_3::medium 19 15.79% 15.79%
elementary_school_math_continuation::two_step_subtraction::grades_2_3::medium 32 28.12% 28.12%
====================================================================
../step47668_hf (9,638,592 params) RESULTS
====================================================================
Raw continuation accuracy 33.20%
Length-normalized accuracy 33.10%
Primary (acc_norm) 33.10%
====================================================================
BananaMind Base Bench 1.1
Overall Elo: 925
Accuracy: 145/350 (41.43%)
Weighted accuracy: 38.44%
language_completion: Elo 1201 | 42/50 (84.00%) | weighted 85.03%
commonsense: Elo 828 | 19/50 (38.00%) | weighted 33.12%
world_knowledge: Elo 867 | 18/50 (36.00%) | weighted 37.93%
context_tracking: Elo 838 | 16/50 (32.00%) | weighted 28.98%
quantitative: Elo 846 | 14/50 (28.00%) | weighted 24.29%
logical_reasoning: Elo 978 | 20/50 (40.00%) | weighted 33.86%
code_completion: Elo 987 | 16/50 (32.00%) | weighted 35.67%
@misc{olmo2026olmo3,
title={Olmo 3},
author={Team Olmo and : and Allyson Ettinger and Amanda Bertsch and Bailey Kuehl and David Graham and David Heineman and Dirk Groeneveld and Faeze Brahman and Finbarr Timbers and Hamish Ivison and Jacob Morrison and Jake Poznanski and Kyle Lo and Luca Soldaini and Matt Jordan and Mayee Chen and Michael Noukhovitch and Nathan Lambert and Pete Walsh and Pradeep Dasigi and Robert Berry and Saumya Malik and Saurabh Shah and Scott Geng and Shane Arora and Shashank Gupta and Taira Anderson and Teng Xiao and Tyler Murray and Tyler Romero and Victoria Graf and Akari Asai and Akshita Bhagia and Alexander Wettig and Alisa Liu and Aman Rangapur and Chloe Anastasiades and Costa Huang and Dustin Schwenk and Harsh Trivedi and Ian Magnusson and Jaron Lochner and Jiacheng Liu and Lester James V. Miranda and Maarten Sap and Malia Morgan and Michael Schmitz and Michal Guerquin and Michael Wilson and Regan Huff and Ronan Le Bras and Rui Xin and Rulin Shao and Sam Skjonsberg and Shannon Zejiang Shen and Shuyue Stella Li and Tucker Wilde and Valentina Pyatkin and Will Merrill and Yapei Chang and Yuling Gu and Zhiyuan Zeng and Ashish Sabharwal and Luke Zettlemoyer and Pang Wei Koh and Ali Farhadi and Noah A. Smith and Hannaneh Hajishirzi},
year={2026},
eprint={2512.13961},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2512.13961},
}
@misc{liu2025regmix,
title={RegMix: Data Mixture as Regression for Language Model Pre-training},
author={Qian Liu and Xiaosen Zheng and Niklas Muennighoff and Guangtao Zeng and Longxu Dou and Tianyu Pang and Jing Jiang and Min Lin},
year={2025},
eprint={2407.01492},
archivePrefix={arXiv},
doi={10.48550/arXiv.2407.01492},
primaryClass={cs.AI},
url={https://arxiv.org/abs/2407.01492},
}
@misc{chen2024hopenovelpositionalencoding,
title={HoPE: A Novel Positional Encoding Without Long-Term Decay for Enhanced Context Awareness and Extrapolation},
author={Yuhan Chen and Ang Lv and Jian Luan and Bin Wang and Wei Liu},
year={2024},
eprint={2410.21216},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2410.21216},
}