2026年9月10日

科技

小米開源“ Xiaomi MiMo ”大模型:以 7B 引數超越 OpenAI o1-mini

ZAKER 科技 4 月 30 日訊息,"Xiaomi MiMo" 公眾號今日發文宣佈,小米開源首個 " 為推理而生 " 的大模型 Xiaomi MiMo,聯動預訓練到後訓練,全面提升推理能力。據介紹,MiMo 是來自全新成立不久的 " 小米大模型 Core 團隊 " 的初步嘗試。 在數學推理(AIME 24-25)和程式碼競賽(LiveCodeBench v5)公開測評集上,MiMo 僅用 7B 的引數規模,超越了 OpenAI 的閉源推理模型 o1-mini 和阿里 Qwen 更大規模的開源推理模型 QwQ-32B-Preview。

ZAKER 科技 4 月 30 日訊息,"Xiaomi MiMo" 公眾號今日發文宣佈,小米開源首個 " 為推理而生 " 的大模型 Xiaomi MiMo,聯動預訓練到後訓練,全面提升推理能力。據介紹,MiMo 是來自全新成立不久的 " 小米大模型 Core 團隊 " 的初步嘗試。

在數學推理(AIME 24-25)和程式碼競賽(LiveCodeBench v5)公開測評集上,MiMo 僅用 7B 的引數規模,超越了 OpenAI 的閉源推理模型 o1-mini 和阿里 Qwen 更大規模的開源推理模型 QwQ-32B-Preview。

官方表示,MiMo 推理能力的提升,由預訓練和後訓練階段中資料和演算法等多層面的創新聯合驅動,包括:

預訓練:核心是讓模型見過更多推理模式資料:著重挖掘富推理語料,併合成約 200B tokens 推理資料。訓練:進行了三階段訓練,逐步提升訓練難度,總訓練 25T tokens。

後訓練:核心是高效穩定的強化學習演算法和框架演算法:提出 Test Difficulty Driven Reward 來緩解困難演算法問題中的獎勵稀疏問題,並引入 Easy Data Re-Sampling 策略,以穩定 RL 訓練。框架:設計了 Seamless Rollout 系統,使得 RL 訓練加速 2.29 倍,驗證加速 1.96 倍。

接著讀

馬斯克親測無安全員 Robotaxi:稱“完美駕駛”

12 月 28 日訊息,特斯拉 CEO 馬斯克近日在美國德州奧斯汀,與特斯拉 AI 總監一同實測無安全員 Robotaxi 網約車。測試覆蓋真實交通環境及複雜路口轉向,車輛執行流暢順暢。 馬斯克稱此次...

256 天前

張水華疑似“仍穿361度外套”,解約風波引熱議

12月29日,“最快女護士”張水華現身黑龍江撫遠,準備參加1月1日的東極新年馬拉松,她身穿361度外套,引發網友熱議。 自2023年起,張水華代言361度,但今年8月哈爾濱馬拉松奪冠後,她曾抱怨公司不...

254 天前