MiraclePlus
用户150
🧙
添加快捷方式
分享
奇绩信号Alpha Sight 12.18【语音版】
输入“/”快速插入内容
🧙
奇绩信号Alpha Sight 12.18【语音版】
🏖️
播客模式已上线,朋友们点击下方音频即可收听 , Powered by OpenMOSS.
OpenMOSS-TTSD已更新至v0.7版本,模型已在
Github
开源,欢迎体验.
12.18奇绩信号Alpha Sight
头条
1.
艾伦人工智能研究所等机构发布OLMo 3:全开放7B和32B参数规模语言模型家族,实现最强完全开放思维模型
信号源
:艾伦人工智能研究所,华盛顿大学,卡内基梅隆大学,斯坦福大学,Mila,蒙特利尔大学,普林斯顿大学,麻省理工学院,马里兰大学
论文链接
:
Olmo 3
项目链接
:
https://huggingface.co/allenai/Olmo-3-1125-32B
🎋
认知提取
OLMo 3通过公开完整模型流程(包括每个训练阶段、检查点、数据点和依赖项),将语言模型开发从'开放权重'提升到'完全开放',就像从只公开建筑蓝图到公开整个建造过程和所有材料清单,其旗舰模型OLMo 3.1 Think 32B成为迄今最强的完全开放思维模型。
论文摘要
OLMo 3是AI2推出的7B和32B参数规模的完全开放语言模型家族,不仅公开最终模型权重,更史无前例地开放了整个模型流程,包括预训练、中期训练、长上下文扩展的每个阶段数据、代码和检查点。其旗舰模型OLMo 3.1 Think 32B在数学、推理、编码等任务上达到最强完全开放模型水平,在训练token数仅为同类模型六分之一的情况下,性能接近Qwen 3等顶级开放权重模型,为AI研究社区提供了前所未有的透明度和可复现性。
50%
50%
核心方法
•
方法框架
:OLMo 3采用三阶段基础模型训练(预训练5.9T tokens、中期训练100B tokens、长上下文扩展50-100B tokens)加三阶段后训练(监督微调、偏好优化、强化学习)的完整流程。创新性地引入了Dolma 3数据集系统(包含9T预训练池、2T中期训练池和640B长上下文池)、OlmoBaseEval评估套件(通过任务聚类和代理指标解决小规模模型评估难题)、以及OlmoRL强化学习框架(实现4倍训练加速),所有组件完全开源。
•
技术细节
:
◦
滑动窗口注意力机制:在四分之三的层中使用4096 token窗口的滑动窗口注意力,最后一层保持完全注意力,在保持推理效率的同时支持65K上下文长度
◦
质量感知上采样:通过截断幂指数函数族对不同质量分位的数据进行差异化采样,顶部5%数据重复7次,底部40%过滤,实现数据质量与数量的最优平衡
◦
Delta Learning偏好调优:通过配对强模型(Qwen3 32B)和弱模型(Qwen3 0.6B)的输出构建高对比度偏好数据,当直接在强模型输出上监督微调反而降低性能时,这种对比学习仍能带来显著提升
◦
olmOCR科学PDF处理:开发专用OCR工具处理2.38亿PDF文档,包含22.3M个超8K tokens的长文档(总计640B tokens),为长上下文训练提供最大规模开放数据集
◦
主动采样强化学习:在GRPO基础上实现连续批处理和即时权重更新,通过主动过滤零梯度样本并动态补充新样本,保持批次大小稳定,训练速度提升4倍
实验成果
•
基础模型性能:OLMo 3 Base 32B在数学任务上得分61.9(超越所有完全开放模型),代码任务39.7分,在多项选择STEM任务74.5分,超越Stanford Marin 32B和Apertus 70B,成为最强完全开放基础模型。在7B规模上,数学和代码性能分别达到54.7和30.7,显著领先同规模完全开放模型。
•
思维模型突破:OLMo 3.1 Think 32B在MATH数据集达96.2%准确率,AIME 2024达80.6%,AIME 2025达78.1%,超越Qwen 2.5、Gemma 2/3等开放权重模型,接近Qwen 3表现。在编码任务上HumanEval+达91.5%,LiveCodeBench v3达83.3%。值得注意的是,相比Qwen 3训练token数减少约6倍,展示了数据质量和训练方法的优越性。
•
完全开放优势:作为唯一公开完整训练流程的思维模型,OLMo 3实现了推理链可追溯到原始训练数据,通过去污染验证(随机奖励训练无性能提升)证明评估数据未泄露。发布的Dolci RL-Zero数据集和OlmoRL代码为社区提供了清晰的强化学习基准,解决了现有开放权重模型因隐藏预训练数据导致的评估污染和可复现性问题。
总结与反思