AI

AI 動態盤點:Sora 正式上線、Gemini 2.0 亮相,AI 代理與產品化成焦點

最近更新 · 2026-09-28 22:18 · 6 條來源

AI 動態盤點:Sora 正式上線,Gemini 2.0 押注原生多模態與 AI 代理

OpenAI 在發布季第三天正式發布 Sora。該模型於 2024 年 2 月首次亮相,經過近 10 個月迭代後上線,並面向 ChatGPT Plus 和 Pro 訂閱用戶提供。[1]

Sora 在文生影片、圖生影片基礎上,加入分鏡腳本、用文字調整原始影片、不同場景影片融合等功能。Plus 用戶可生成最多 50 個進階影片、720p、5 秒;Pro 用戶最多 500 個進階影片、1080p、20 秒,並可移除浮水印。[1]

Google 發布 Gemini 2.0 Flash,稱其是首家實現原生多模態輸入輸出的模型。DeepMind CEO Hassabis 表示,其效能與 1.5 Pro 一樣出色,速度是 1.5 Pro 的兩倍,並在關鍵基準測試中超越 1.5 Pro。[2]

Gemini 2.0 Flash 可原生生成音訊和圖像,支援多語言 TTS、圖像輸出與對話式多輪編輯,並可透過單一 API 呼叫生成文字、音訊和圖像的整合回應,所有圖像和音訊輸出啟用 SynthID 隱形浮水印。[2]

Google DeepMind 科學家 Nenad Tomasev 表示,強化學習讓 AI 不再受限於人類知識;未來相較於依賴單一模型,會建構具備多種能力的 AI 代理。Kaggle CEO D.Sculley 稱過去一年 AI 進展比之前 7 年還多。[3]

新創公司方面,AIGCode 推出面向產品經理的 AutoCoder,無需程式能力即可生成軟體。團隊從 MoE 演進到 PLE 混合多專家架構,稱其 7B 錫月大模型在程式碼方面可與 GPT-4o 等主流模型媲美。[4]

flomo 共同創辦人少楠表示對 AI 感到恐慌但不著急。flomo 新增相關筆記、找一找功能後,成長是近幾年來比較積極的訊號。[5]

LOOI 是華人團隊 TangibleFuture 在 CES 上亮相的 AI 硬體,基於手機終端互動。團隊稱如果把它當消費品可以打 70 分,但從心裡想做的東西只能給 30 分,首先要讓它成為成功的消費品。[6]

分析

從上述動態來看,多模態生成與 AI 代理成為大模型競爭焦點,產品化與落地場景受到更多關注。[1][2][3]

來源

← 全部AI報道