AI

AI 动态盘点:Sora 正式上线、Gemini 2.0 亮相,智能体与产品化成焦点

最近更新 · 2026-09-28 22:18 · 6 条来源

AI 动态盘点:Sora 正式上线,Gemini 2.0 押注原生多模态与 Agent

OpenAI 在发布季第三天正式发布 Sora。该模型于 2024 年 2 月首次亮相,经过近 10 个月迭代后上线,并面向 ChatGPT Plus 和 Pro 订阅用户提供。[1]

Sora 在文生视频、图生视频基础上,加入故事板、用文本调整原视频、不同场景视频融合等功能。Plus 用户可生成最多 50 个高级视频、720p、5 秒;Pro 用户最多 500 个高级视频、1080p、20 秒,并可去水印。[1]

谷歌发布 Gemini 2.0 Flash,称其是首家实现原生多模态输入输出的模型。DeepMind CEO Hassabis 表示,其表现与 1.5 Pro 一样出色,速度是 1.5 Pro 的两倍,并在关键基准测试中超越 1.5 Pro。[2]

Gemini 2.0 Flash 可原生生成音频和图像,支持多语言 TTS、图像输出与对话式多轮编辑,并可通过单一 API 调用生成文本、音频和图像的集成响应,所有图像和音频输出启用 SynthID 隐形水印。[2]

谷歌 DeepMind 科学家 Nenad Tomasev 表示,强化学习让 AI 不再受人类知识限制;未来相比依赖单一模型,会构建拥有多种能力的智能体。Kaggle CEO D.Sculley 称过去一年 AI 进展比之前 7 年还多。[3]

创业公司方面,AIGCode 推出面向产品经理的 AutoCoder,无需代码能力即可生成软件。团队从 MoE 演进到 PLE 混合多专家架构,称其 7B 锡月大模型在代码方面可与 GPT-4o 等主流模型媲美。[4]

flomo 联合创始人少楠表示对 AI 感到恐慌但不着急。flomo 新增相关笔记、找一找功能后,增长是近些年来比较积极的信号。[5]

LOOI 是华人团队 TangibleFuture 在 CES 上亮相的 AI 硬件,基于手机终端交互。团队称如果把它当消费品可以打 70 分,但从心里想做的东西只能给 30 分,首先要让它成为成功的消费品。[6]

分析

从上述动态看,多模态生成与智能体成为大模型竞争焦点,产品化与落地场景受到更多关注。[1][2][3]

来源

← 全部AI报道