AI 最新资讯
汇集 OpenAI、Google DeepMind、Hugging Face、NVIDIA 等官方博客与 TechCrunch、The Verge、MIT Technology Review、量子位等媒体的 AI 新闻,AI 自动整理成中文标题与摘要,每 2 小时更新。点击标题跳转原文。
- 量子位·模型发布
匿名模型玉兔登顶双榜 实测表现突出
匿名模型“玉兔模型”在双榜排名登顶,相关 Coding 实测记录已公开,显示其在速度与能力上表现突出。该模型的来源与发布方尚未披露。
阅读原文 → - The Decoder·模型发布开源
英伟达发布 Nemotron 3 说话人分离模型
英伟达推出 Nemotron 3 Diarization,这是一款约 1 亿参数的免费模型,可实时判断对话中正在说话的人,最多支持八位说话人。它可用于会议记录、字幕生成等需要区分发言者的场景。
阅读原文 →
- IT之家·模型发布产品更新
MiniMax M3.1-Flash-Preview 上线
MiniMax 宣布最新文本模型 M3.1-Flash-Preview 上线 MiniMax Code 平台,官方同步发出额度重置卡,重置用户 Token Plan 额度,并提供签到双倍积分、免费领 Token 等福利。该模型面向日常开发,覆盖问题定位、代码实现、测试验证到成果交付。
阅读原文 → - 量子位·模型发布行业动态
索辰科技发布具身模型与物理测评标准
索辰科技加码世界模型方向,并与战略投资企业美梦空间联合发布具身模型及物理测评标准。原文认为,“世界模型”正成为具身智能跨越商业化“奇点”的新叙事。
阅读原文 → - 量子位·研究进展模型发布
团队发布Physical AI模型Simate-beta
有团队推出面向 Physical AI 的首版模型 Simate-beta,并将训练、推理与评测全流程接入自研 Infra。其通过任务编排与资源调度,可并行推进数十条相互独立的研究路线。
阅读原文 → - IT之家·模型发布产品更新
美团上线 LongCat-2.5-Preview 大模型
美团 LongCat API 开放平台上线新一代大模型 LongCat-2.5-Preview,主打长程任务与多模态能力,并同步开放 API 与网页端入口。该模型总参数约 1.6 万亿、每次推理激活约 480 亿,原生支持 100 万 token 上下文,新增图片理解并适配 Claude Code 等开发环境。
阅读原文 → - TechCrunch AI·模型发布产品更新
Meta 的 Muse 抢走 OpenAI 与 Anthropic 风头
Anthropic 发布 Opus 5.5,OpenAI 在 90 分钟后更新 GPT-6,两家公司几乎同时上新模型。但据报真正抢走焦点的是 Meta 的个人 AI 代理 Muse,其早期数据超过 ChatGPT,并将走向智能眼镜等设备。
阅读原文 → - IT之家·模型发布行业动态
OpenAI 将预览网络安全模型 GPT-6 Cyber
据《财富》杂志消息,OpenAI 计划在未来数日内预览网络安全专用模型 GPT-6 Cyber,并推出配套产品,帮助客户更安全、自动化地部署该模型。相关模型与产品预计 9 月 29 日在旧金山开发者大会亮相,仅限申请准入客户参与 Alpha 测试。
阅读原文 → - The Decoder·开源模型发布
Black Forest Labs 发布开源机器人模型 FLUX 3 Action
Black Forest Labs 推出开源世界动作模型 FLUX 3 Action,可通过摄像头画面预测机器人下一步动作。它仅有 70 亿参数,在 RoboLab-120 基准上创下纪录,运行速度最高为前代最优模型的 3.95 倍。
阅读原文 → - Google DeepMind·模型发布
Google 发布 Gemini 3.8 Live 与 Live Avatar
Google DeepMind 推出 Gemini 3.8 Live,并带来 Live Avatar 功能。原文未给出更多细节与上线范围。
阅读原文 → - Hugging Face·模型发布开源
LFM2.5-VL-DSpark:加速视觉语言模型
Hugging Face 上出现名为 LFM2.5-VL-DSpark 的内容,主题是加速视觉语言模型。
阅读原文 → - The Decoder·模型发布
DeepMind新负责人希望Gemini 4尽早发布
谷歌DeepMind负责人Koray Kavukcuoglu表示,希望Gemini 4比年底更早发布,该模型已进入后训练阶段,并在内部编程工具Antigravity中运行。他认为追逐AGI“不是正确的讨论”,可信赖的智能体更重要。
阅读原文 →
- The Verge AI·模型发布行业动态
谷歌 DeepMind 新负责人:Gemini 4 接近就绪
谷歌 DeepMind 新任负责人 Koray Kavukcuoglu 首次以该身份接受采访时表示,Gemini 4 目前处于打磨阶段,发布临近。此前谷歌在旗舰 AI 模型的发布节奏上一度落后于竞争对手。
阅读原文 →
- IT之家·模型发布
谷歌确认新一代旗舰模型 Gemini 4 即将推出
谷歌 DeepMind 负责人卡武克奥卢透露,Gemini 4 已进入后训练初期,有望远早于年底推出,谷歌会继续快速迭代。这是 Gemini 3 系列之后首款下一代旗舰模型,公司当前重点已转向该模型。
阅读原文 → - IT之家·模型发布产品更新
高通发布 1-bit Bonsai 视觉模型
在 2026 骁龙峰会上,高通与 PrismML 在骁龙 AR1 Gen 1 智能眼镜平台上本地运行 20 亿参数的 1-bit 量化 Bonsai 视觉模型。官方称其内存占用约为传统 4-bit 模型的 1/4、文本生成速度翻倍,可支持离线识物、翻译与语音问答,并改善续航与发热。
阅读原文 → - IT之家·产品更新模型发布
腾讯 Hy 翻译 App 上线,支持 33 种语言互译
腾讯混元宣布“腾讯 Hy 翻译”App 上线,同步支持小程序、插件与 PC 端体验。它基于开源的 Hy-MT2 翻译模型,支持 33 种语言互译并覆盖 5 种少数民族语言及方言,提供语音、拍照与离线翻译,已在 12 个国家和地区上线。
阅读原文 → - IT之家·模型发布
消息称 Kimi K3.1 下月登场
科技媒体消息称,月之暗面正筹备推出 Kimi K3.1 模型,或于下月登场,内部配置文件中出现 Low、High、Max 三档推理强度。爆料还提到最高 100 万 Token 上下文、Agent 模式与多智能体协作等能力。
阅读原文 → - The Decoder·模型发布
Google 发布 Gemini 3.8 Flash TTS 模型
Google 推出 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 两款语音合成模型,支持 100 多种语言。Flash TTS 可用文字描述从零设计新音色,两者均支持为单行台词加舞台提示、用一份脚本生成双人对话,并可用 30 秒样本克隆音色。
阅读原文 → - IT之家·模型发布产品更新
谷歌发布 Gemini 3.8 Flash 文本转语音模型
谷歌推出 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示定制语音、约 30 秒音频复刻声音,并内置 SynthID 水印等保护。前者面向角色创意设计,后者面向大规模配音场景。
阅读原文 → - Google DeepMind·模型发布
Gemini 3.8 文本转语音模型亮相
Google DeepMind 发布 Gemini 3.8 文本转语音模型,为用户提供新的语音生成能力。
阅读原文 →