AI

從個人 AI 助理到腦科學 Infra:AI 代理開始補上觸覺、記憶與物理世界

最近更新 · 2026-10-10 10:05 · 6 條來源

從個人 AI 助理到腦科學 Infra:AI 代理開始補上觸覺、記憶與物理世界

近期,AI 領域的進展不再只是模型參數和榜單分數的競賽,而是同時向個人日常、腦科學基礎設施、具身操作和企業部署四個方向滲透。從 Today AI 的十天體驗,到鯤為的超音波穿顱讀腦,再到 Sharpa、星動紀元、MirroS 與 openJiuwen 的新動作,一條共同主線逐漸清晰:AI 代理要真正進入現實世界,必須補上感知、記憶、行動與安全運行的系統能力。

個人 AI 助理先學會「主動」和「同一段對話」

Today AI 由 Teambition 創辦人齊俊元打造,國內版於 9 月 24 日上線,已接入飛書、釘釘、騰訊文件和電子信箱等國內常用應用 [1]。作者體驗十天後發現,它的 Personal 之處不只是回答問題,而是根據使用者提供的個人資訊主動生成早晚報,推送喜歡的球隊動態、郵件摘要和刊物封面文章;在同一個對話框裡,使用者可以上一秒收集選題資料,下一秒追問某款遊戲是否發售,Today 能接住話題並回到工作任務 [1]。電腦版把對話、簡報、任務、記憶和關聯應用放在同一介面,連上飛書後,它能讀取近一週工作文件並每天早上 9 點推送選題 [1]。在更重的任務中,作者把遊戲 mod 的 zip 包發給 Today,它自行拆包、讀文件並呼叫 Claude Opus 5 開始中文化,但最後一步「中文化檔案放在遊戲目錄哪裡」卻反覆給出自信卻無效的指令 [1]。這既展示了 Personal AI 用長期記憶和主動服務降低互動成本的可能,也暴露了它在真實操作閉環中的可靠性短板。

用低頻超音波「讀腦」,鯤為要做腦科學 AGI 的 Infra

深圳公司鯤為科技近期完成 4 億元新一輪募資,新增股東包括 XVC、紅杉中國,老股東夏爾巴、騰訊進一步加碼 [2]。其技術路線放棄透過不斷提高頻率換取清晰度的行業慣性,轉向低頻,把算力與演算法引入物理聲場,在低頻段兼顧顱骨穿透力與高解析度即時成像 [2]。實測中,海外頂級旗艦彩色超音波在穿透顱骨後只能拼出模糊輪廓,而鯤為設備可清晰呈現中腦核團、側腦室乃至微細血管中的血流動態 [2]。創辦人劉家家將這一路徑概括為「聲學空間智慧」,並稱其複刻了蝙蝠的聲學空間感知能力:超音波每秒產生的原始回波資料流高達 10GB,模型需在極小參數量下即時解析三維空間中的體素反射特徵 [2]。鯤為已實現數千萬訂單,目標不止於顱腦超音波設備,而是提供硬體和基礎軟體平台 kOS,成為賦能腦科學 AGI 的 Infra 公司 [2]。

觸覺成為靈巧操作的入口,Sharpa 一次發布三款產品

在 IROS 上,Sharpa 發布第一款全自研通用人形機器人 D01,以及新一代全觸覺超緊湊、輕量化靈巧手 W02 和高保真外骨骼觸感資料手套 AE01 [3]。D01 的幾個數字圍繞靈巧操作展開:手臂載荷自重比接近 1:1,最大末端執行器速度超過 10.5m/s,通訊頻率 1000Hz,重複定位精度 0.2mm,球形腕關節採用 1:1 人體尺度設計;電子皮膚覆蓋全身,觸覺覆蓋上半身,觸覺取樣率 100Hz,力感知範圍 0.1—20N,力解析度 0.2N [3]。W02 反而把主動自由度從上一代 W01 的 22 個減少到 21 個,整手尺寸縮小約 30%,並實現「零抓握半徑」,指尖視覺觸覺感測器力感知範圍 5mN—30N,空間解析度 1mm [3]。AE01 透過 22 個編碼器捕捉操作者自然手部動作,並把機器人端觸覺狀態回饋給人,用於精準遠端操作和第一視角資料蒐集 [3]。這些產品共同指向一個判斷:機器人進入真實工作空間後,視覺只能告訴它「前面有東西」,觸覺才能回答「哪裡碰到了、受力多大、有沒有滑動」。

世界動作模型登頂:星動紀元 VPP2 把預測和動作拆開

星動紀元自研的世界動作模型 VPP2 近日登頂 RoboDojo 模擬榜單,綜合平均成功率 32.26%,綜合平均得分 39.26 分,兩個指標均列第一;在泛化能力、精細操作、記憶能力三個維度上,VPP2 也拔得頭籌 [4]。作為對比,在 RoboDojo 模擬基準的後訓練評測中,GPT-6-Astra 的平均成功率為 22.48%,平均得分 28.97 分 [4]。VPP2 沒有額外加資料,也沒用 Agent RSI 等增強手段,僅靠標準資料集完成提升,說明其效能來自預訓練和基座泛化 [4]。技術路線上,團隊將影片預測與動作學習分階段訓練,先以阿里開源的 Wan2.1-I2V-14B 為基礎,整合機器人操作、人類活動、通用影片等資料,讓模型學習一次完整操作從開始到結束的變化;在機器人操作影片的指令遵循測試中,14B 參數的 VPP2 達到 90% 成功率,而 64B 參數的 Cosmos3 為 78% [4]。之後,VPP2 引入 0.9B 參數的擴散 Transformer 作為動作專家,動作訓練初期凍結影片模型基礎參數,僅透過 LoRA 適配,以保住泛化能力;最終影片預測約耗時 0.12 秒,動作專家約耗時 0.1 秒,整體動作片段生成延遲約 0.22 秒 [4]。在真實 ALOHA 雙臂機器人上,VPP2 在抓取、放置、堆疊、摺疊、傾倒等 10 類零樣本任務中平均成功率 58.5%,高於 π0.5 的 40% [4]。

程式碼造世界、擴散繪現實:AgentGarten 讓 AI 代理邊玩邊進化

MirroS 團隊發布 AgentGarten,將可執行的程式碼環境與即時神經渲染器連接起來:程式碼定義物理規則,模型生成視覺回饋,以超過 30 fps 的吞吐讓 AI 代理持續與世界互動 [5]。在經典捉迷藏實驗中,躲藏者在第 4 輪學會搬動擋板搭建掩體,搜尋者在第 10 輪掌握借坡道翻牆;一次跳躍失敗後,搜尋者還會主動推近坡道、調整位置再嘗試 [5]。作為對照,OpenAI 2019 年的研究依靠從零開始的強化學習,摸索出掩體搭建經歷約 2500 萬局,學會借坡道翻牆經歷約 1 億局 [5]。AgentGarten 的解法是讓物理交給程式碼、光影交給神經模型:AI 代理給出動作指令後,程式碼環境立即計算碰撞與狀態更新,並從第一人稱視角匯出輕量幾何草圖,神經渲染器再結合視覺記憶即時生成下一幀 [5]。團隊還提出 Adversarial Forcing 訓練方法和精確重播機制,以應對串流生成中的誤差累積與長序列時序一致性挑戰 [5]。這套「探索—回顧—沉澱」循環,讓虛擬環境的擴充成本從美術勞動密集轉向程式碼程序化擴展型。

企業級 AgentOS 開源:從能用到可管、可控、可擴展

openJiuwen 發布並開源企業級 AgentOS,由華為 2012 實驗室、華為雲、計算、終端、算力先遣隊等團隊聯合高校與企業開發者構建,將多代理協同、自演進、算力親和與企業級安全可靠能力融入統一底座 [6]。它透過蜂群協作與工作流程編排支援任務拆解、角色分工和並行執行,並允許人在關鍵環節參與判斷;依託執行軌跡、使用者回饋與記憶機制,AI 代理可以優化技能與協作方式,把有效經驗沉澱為可複用能力 [6]。在運行層面,AgentOS 透過軟硬協同、資源調度和推理優化提升算力利用效率,並以多租戶隔離、安全沙箱、權限管理及安全護欄約束資料存取和工具呼叫,同時以故障復原等機制支撐任務高可靠持續運行 [6]。在 HC2026 上,華為發布基於 Jiuwen AgentOS 的一體機開源 Agent 加速平台及解決方案,平台內建統一 Agent 閘道、分散式運行底座和 WorkSwarm 辦公/程式設計統一工作台,可實現小時級企業端到端私有化部署 [6]。外掛化架構與開放的北向生態,讓技能、連接器、外掛、專家和專家團五類資產可以靈活組合,並透過 Agentic Hub 發布、取得和共享 [6]。

共同趨勢:AI 代理正在補齊「身體」與「底座」

把這些線索放在一起看,個人 AI 助理在爭奪使用者日常入口,腦科學超音波和具身智慧在爭奪物理世界的感知與操作能力,而企業級 AgentOS 則在解決多代理協同、安全與部署問題。它們的共同點是,AI 不再只是被動回答問題的模型,而是試圖長期記住目標、主動取得資訊、透過觸覺和視覺閉環行動,並在企業環境中可管理、可隔離、可復原。接下來值得關注的是,Today AI 這類個人助理能否把「輕快對話」推進到可靠的重任務執行;鯤為的 kOS 能否被腦機介面 Lab 和 NeuroAI 模型公司真正呼叫;Sharpa 的觸覺資料、星動紀元的 VPP2 與 AgentGarten 的即時環境,能否讓機器人從模擬榜單和 Demo 走向穩定商業價值;openJiuwen 的 AgentOS 又能否把小時級私有化部署轉化為行業 AI 代理的規模化落地。 [1][2][3][4][5][6]

來源

← 全部AI報道