AI 动态盘点:Sora 正式上线、Gemini 2.0 亮相,智能体与产品化成焦点
最近更新 · 2026-09-28 22:18 · 6 条来源
AI 动态盘点:Sora 正式上线,Gemini 2.0 押注原生多模态与 Agent
OpenAI 在发布季第三天正式发布 Sora。该模型于 2024 年 2 月首次亮相,经过近 10 个月迭代后上线,并面向 ChatGPT Plus 和 Pro 订阅用户提供。[1]
Sora 在文生视频、图生视频基础上,加入故事板、用文本调整原视频、不同场景视频融合等功能。Plus 用户可生成最多 50 个高级视频、720p、5 秒;Pro 用户最多 500 个高级视频、1080p、20 秒,并可去水印。[1]
谷歌发布 Gemini 2.0 Flash,称其是首家实现原生多模态输入输出的模型。DeepMind CEO Hassabis 表示,其表现与 1.5 Pro 一样出色,速度是 1.5 Pro 的两倍,并在关键基准测试中超越 1.5 Pro。[2]
Gemini 2.0 Flash 可原生生成音频和图像,支持多语言 TTS、图像输出与对话式多轮编辑,并可通过单一 API 调用生成文本、音频和图像的集成响应,所有图像和音频输出启用 SynthID 隐形水印。[2]
谷歌 DeepMind 科学家 Nenad Tomasev 表示,强化学习让 AI 不再受人类知识限制;未来相比依赖单一模型,会构建拥有多种能力的智能体。Kaggle CEO D.Sculley 称过去一年 AI 进展比之前 7 年还多。[3]
创业公司方面,AIGCode 推出面向产品经理的 AutoCoder,无需代码能力即可生成软件。团队从 MoE 演进到 PLE 混合多专家架构,称其 7B 锡月大模型在代码方面可与 GPT-4o 等主流模型媲美。[4]
flomo 联合创始人少楠表示对 AI 感到恐慌但不着急。flomo 新增相关笔记、找一找功能后,增长是近些年来比较积极的信号。[5]
LOOI 是华人团队 TangibleFuture 在 CES 上亮相的 AI 硬件,基于手机终端交互。团队称如果把它当消费品可以打 70 分,但从心里想做的东西只能给 30 分,首先要让它成为成功的消费品。[6]
分析
来源
- [1] OpenAI发布季第三天:Sora正式发布!独立产品、完整视频工作流 · 2026-09-28 21:16 · www.geekpark.net
- [2] Gemini 2.0发布!主打Agent+多模态,性能超1.5 Pro、可直接生成音频、图片 · 2026-09-28 21:15 · www.geekpark.net
- [3] 对话谷歌科学家:智能体是大模型落地重点,AI的未来是大小模型协作 · 2026-09-28 21:15 · www.geekpark.net
- [4] 对话AIGCode创始人:只有从底层训模型,才能真正释放Coding生产力 · 2026-09-28 21:16 · www.geekpark.net
- [5] 对话flomo少楠:当然会对AI感到恐慌,但别着急 · 2026-09-28 21:16 · www.geekpark.net
- [6] 对话 LOOI:硬件作为内容,像设计生命一样设计机器人 · 2026-09-28 21:21 · www.geekpark.net