【藝文人士的AI課】035---近期重新洗牌的AI戰場:從DeepSeek、Kimi、Seedance到機器人與音樂版權
- Jimmy lane
- 6分钟前
- 讀畢需時 18 分鐘
第33期與第34期介紹完AI電影的發展之後,這幾個月以來,人工智慧產業又出現不少新的進展、新技術與新局面。以下就為各位一一介紹。
新的大型模型陸續推出,影片生成開始同時處理畫面、聲音與表演,晶片公司重新調整AI運算的布局,中國的人形機器人與低空經濟也進一步走向產業化。另一方面,AI音樂的版權爭議不但沒有結束,反而進入更具體的舉證、授權與談判階段。
過去人們爭論的是AI究竟有沒有使用受著作權保護的音樂,現在已經開始追查它用了哪些錄音、從哪裡取得、應該付多少錢,以及誰有資格代表詞曲作者、歌手、演奏者與唱片公司談判。模型、晶片、影音、機器人與版權看似分散,其實都在面對同一個現實:AI產業經過早期高速成長後,必須證明自己能夠長期運作。
一、DeepSeek V4先行,Kimi K3接棒
最近中國大型模型受到最多注意的兩個更新,分別來自DeepSeek與Moonshot AI。時間順序上,是DeepSeek在前,Kimi在後。
2026年4月24日,DeepSeek推出V4 Preview,分為V4 Pro與V4 Flash。V4 Pro總參數規模為1.6兆、每次啟動約490億參數;V4 Flash則是2,840億總參數、每次啟動約130億參數。兩個版本都支援100萬token上下文,也都提供思考與非思考模式。
DeepSeek這次的重點不只有參數增加。官方把焦點放在長上下文效率、程式設計、推理與Agent任務,並使用token壓縮與DeepSeek Sparse Attention,降低處理超長文件時的運算和記憶體負擔。V4 Flash則負責速度與成本,讓一般應用不必每次都呼叫最大的模型。
這種Pro與Flash分工,說明模型公司已經不能只拿出一個體積最大的版本。企業需要高能力模型處理複雜任務,也需要較小、較快、較便宜的模型承接大量日常請求。模型能力、推理速度、記憶體使用與API價格,必須一起計算。
DeepSeek也宣布,原來的deepseek-chat與deepseek-reasoner於7月24日停止服務,使用者必須轉移至V4系列。這不是只供展示的研究發布,而是服務架構正式換代。官方宣稱V4 Pro具備接近頂尖閉源模型的能力,但仍需更多獨立測試與長期使用驗證。
到了7月16日,Moonshot AI推出Kimi K3,把中國模型的討論熱度推向另一個高點。Kimi K3主打長時間程式設計、知識工作、多模態理解與平行任務。Kimi目前的產品範圍也已經超過聊天工具,包括程式代理、文件、簡報、試算表、網站製作、深度研究及多Agent協作。
DeepSeek與Kimi雖然常被放在一起比較,兩家公司強調的方向並不完全相同。DeepSeek較著重開放模型、推理效率、成本與不同運算環境的部署;Kimi則把長上下文、多模態、知識工作和多任務協作放在一起,希望模型能讀取大量文件、理解圖片和表格、處理較長的程式專案,再將複雜工作分給不同AI單元同時進行。
Moonshot AI創辦人楊植麟的研究背景,也讓Kimi的長上下文發展有一條可以追溯的技術脈絡。早在ChatGPT問世以前,他就是Transformer-XL的共同作者與XLNet第一作者。Transformer-XL研究如何突破固定長度的序列限制,XLNet則重新設計語言模型的預訓練方法。今天Kimi重視長文件、長程記憶與大規模知識處理,和團隊過去的研究經驗確實存在連續性。
當然,不能因為創辦人曾參與重要論文,就直接推論Kimi一定超過所有競爭者。模型最後仍要接受速度、穩定性、幻覺率、成本、工具操作及真實使用環境的檢驗。但這段研究歷史至少說明,中國模型公司背後不只有資金和伺服器,也包含一批在生成式AI爆紅以前就已參與前沿研究的技術人員。
DeepSeek在4月先更新,Kimi在7月接棒,阿里的Qwen、智譜的GLM、MiniMax與字節跳動Seed也各自推進。中國目前並沒有一家獨占所有能力的公司,而是形成多條路線同時競爭:有人比開放權重,有人比低成本,有人比企業部署,有人比多模態,也有人把模型直接接入電商、雲端、短影音與辦公軟體。
獨立評測與價格也顯示,能力最高不等於使用成本最低。Artificial Analysis的綜合指標中,Kimi K3約57分、GLM-5.2約51分,DeepSeek V4 Pro在高推理模式約44分;但API牌價方面,Kimi K3每百萬輸入token約3美元、輸出15美元,DeepSeek V4 Pro則約為0.435美元與0.87美元,兩者輸出價格相差約17倍。
評測分數會隨版本與測試方法改變,價格也可能調整,但目前已足以說明:企業選模型時不能只看排行榜,還要計算延遲、token消耗與任務成功率。
二、生成式影音全面換代:從模型競賽走向製片工作流
二月份的專欄已經介紹過Seedance 2.0,以及它引發的好萊塢版權、角色授權與真人肖像爭議,本期不再重述。幾個月後重新觀察,生成式影片的競爭重點已經改變:不只比誰能生成最漂亮的十秒或十五秒畫面,也開始比較聲音同步、人物一致性、既有影片修改及完整製作流程。
中國市場目前形成幾條不同路線。字節跳動Seedance 2.0強調文字、圖片、音訊與影片的統一輸入,以及原生聲畫、多模態參考與影片編輯;快手Kling 3.0及3.0 Omni加強原生聲音、多鏡頭敘事、人物元素控制與4K輸出;MiniMax Hailuo 2.3著重複雜動作、人物微表情、視覺特效與快速生成;阿里Wan系列則以開放權重、本地部署、首尾幀控制與影片編輯建立差異。
美國公司的重點,則逐漸從單次生成轉向AI製片平台。Google持續發展Veo 3.1與Gemini Omni,並把影片、圖像與多模態模型集中到Google Flow。Runway以Gen-4.5負責生成,再由Aleph 2.0修改既有影片;Luma Ray3.2強化生成長度、HDR與鏡頭控制;Adobe Firefly則把自家模型及Google、Kling、Runway、Luma等不同公司的模型,接入素材庫、時間軸與Premiere工作流。
Google同期推出的Nano Banana 2 Lite,是速度更快、成本更低的Gemini Image模型。它雖然不是影片模型,卻能負責角色、服裝、場景、物件和分鏡圖,再交由Veo或Gemini Omni轉成影片。這裡應注意名稱:Nano Banana 2 Lite屬於Gemini Image系列;Imagen 4則是Google另一條圖像生成產品線,兩者不能混寫成「Google Image 2」。
OpenAI的發展則呈現另一種結果。Sora 2曾因原生聲音與物理運動受到注意,但獨立的Sora網頁和App已於2026年4月26日停止服務,API也預定在9月24日結束。這說明影片模型即使曾經引起巨大討論,仍要面對成本、產品定位與平台策略的長期檢驗。
英國公司的方向又不完全相同。倫敦的Synthesia 3.0集中在AI主播、企業影片、教育訓練、跨語配音與互動式Video Agents;Stability AI繼續發展可部署的多視角、3D與4D影片模型。加拿大的Moonvalley則以Marey強調取得授權的高解析度訓練影片,藉由資料來源與商用安全建立差異。
我製作《CYBER HER》時,最初採取多平台混合工作流,依照不同鏡頭、角色、聲音與素材需求,交替使用TopMediai、Seedance 1.5與2.0、Gemini Omni,以及通義千問的Qwen Studio。這種方法可以利用不同模型的優點,但素材、角色設定、提示詞和參考圖片必須在多個平台之間反覆移動。
隨著Google Flow整合Veo、Gemini Omni與Nano Banana系列,我開始把《CYBER HER》的主要生成工作移到Flow,再由其他工具補強特殊鏡頭。這不是完全放棄原來的平台,而是從多套工具平行混用,轉向以Google Flow作為主要製作中心。
實際使用時,角色臉部、服裝、道具、多人物台詞及中文唇形仍可能出現誤差,參考圖片太多也可能使模型誤判主體。這些經驗說明,影片AI降低的是單一鏡頭的製作門檻;真正的長篇作品,仍需要創作者管理角色、分鏡、素材、版本及後期修正。
因此,2026年中的影片AI競爭,已經從單一模型的畫質比較,走向完整製作系統的競爭。未來真正能成為生產主力的,不一定只是排行榜分數最高的模型,而是能讓創作者穩定管理素材、修改結果並完成作品的平台。
三、COMPUTEX透露的新方向:每一次AI推理都要計算成本
本刊過去曾經談過AI PC與本地運算,但今年台北國際電腦展更值得注意的變化,是業界開始把焦點從「裝置能不能執行AI」,轉向「每一次AI推理需要多少晶片、電力與成本」。
今年COMPUTEX以「AI Together」為主題,展區涵蓋AI運算、機器人、移動裝置與新世代科技。和前幾年相比,各家公司不再只強調模型規模或晶片算力,而是更具體地討論推理部署、電力消耗、散熱、機架密度、資料傳輸及邊緣端運算。
這也把前一節的模型競賽帶到更現實的層面。模型能否普遍進入企業與日常生活,不只取決於它有多聰明,也取決於每完成一次查詢、搜尋、翻譯、程式設計或影音生成,需要消耗多少運算資源。
模型訓練通常是集中而龐大的前期支出,但模型正式上線之後,每天可能要處理數以億計的使用要求。當AI逐漸進入搜尋、客服、辦公軟體、影音製作與企業服務,長期成本便來自每一次持續累積的推理。單次費用看起來也許不高,乘上大量使用者與長時間運作後,晶片、記憶體、電力及散熱成本都會成為企業必須面對的壓力。
Intel在COMPUTEX公布以Intel 18A製程打造的Xeon 6+,這也是Intel 18A首次應用於資料中心CPU。產品方向著重高密度部署、橫向擴張與大量並行任務。Intel同時展示由Xeon負責系統調度,搭配SambaNova RDU及NVIDIA Blackwell GPU的分離式推理架構,讓不同晶片分別處理資料準備、模型解碼與運算執行。
這種分工反映出一個重要轉變:AI資料中心不可能把所有工作都交給價格最高、耗電量最大的GPU。資料搬移、任務調度、一般運算、模型推理與結果輸出,各自適合不同類型的處理器。未來的競爭不只看誰擁有最多GPU,也要看誰能更有效率地整合CPU、GPU、NPU、記憶體、網路與軟體系統。
Qualcomm則與華碩展示Ascent QN10迷你電腦,採用Snapdragon X2 Elite,NPU算力達80 TOPS,機身體積不到0.7公升。這類裝置希望把一部分AI工作留在本地執行,使文件、聲音與影像不必全部傳送到遠端雲端。
本地AI的優點包括較低延遲、離線使用與資料隱私,也可以減少部分雲端推理支出;限制則是記憶體容量、模型大小、散熱及裝置效能。未來更可能普及的方式,不是完全依賴本地或完全依賴雲端,而是兩者分工的混合運算:私密資料、即時語音、初步整理與輕量任務在本地完成,大型推理、多人協作與高畫質影音生成再交給雲端。
因此,今年COMPUTEX真正透露的新方向,不只是又推出一批更快的晶片,而是AI產業開始計算每一次服務背後的實際成本。模型競爭進入下一階段後,能否控制推理費用、電力消耗與部署複雜度,可能和模型本身的能力同樣重要。
四、Alphabet一年準備投入近兩千億美元
模型能力不斷提升的背後,是更龐大的資本支出。
Alphabet在2026年第二季財報後,再度上調全年資本支出預估,由原來的1,800億至1,900億美元,增加到1,950億至2,050億美元。第二季資本支出為449億美元,其中大部分投入支援AI的技術基礎設施;這些基礎設施投資約60%用在伺服器,40%用於資料中心和網路設備。
Google Cloud第二季營收年增82%,達248億美元,待履行合約金額則增加至5,140億美元。但Alphabet同季自由現金流為負59億美元,投資人因此開始追問:AI帶來的收入,能否追上資料中心、晶片、電力與網路設備的投資速度?
這些數字不能只解讀成Google燒錢。雲端收入與企業AI需求的確大幅上升,Alphabet也開始從向客戶銷售TPU系統取得收入;問題是公司必須在需求出現以前先擴建容量,折舊、電力及資料中心營運成本也會持續增加。
這場競賽因此進入財務耐力賽。大型科技公司不但要證明模型更聰明,也要證明使用者和企業願意持續付費,而且每項AI服務的收入足以負擔長期運算成本。
五、低空經濟進入法規與營運階段
另一個值得介紹的新局面,是中國的低空經濟。
低空經濟通常指3,000公尺以下,由無人機、電動垂直起降飛行器、物流、觀光、巡檢、農業及相關通訊和管理系統形成的產業。過去這類消息常停留在展覽、試飛與城市示範,現在開始建立較完整的管理制度。
中國修訂後的《民用航空法》自2026年7月1日生效,首次把無人駕駛航空器更正式地納入法律規範。製造商必須為產品設定識別碼,生產、進口、維修及營運也涉及適航與安全要求。微型、輕型和小型民用無人機與中大型機種的規範有所不同,中大型機種需要向民航主管機關申請適航認證。
這些規定看起來增加限制,卻是產業長期發展不可缺少的一步。物流無人機、載人eVTOL與大量城市飛行器如果沒有識別、航線、責任、保險與事故調查制度,就不可能安全地進入日常生活。
中國交通部資料顯示,2024年以無人機運送的包裹已達270萬件,內容從餐點到醫療用品都有。京東、美團等企業也持續測試物流航線。無人機在偏遠地區可能縮短配送時間,在都市中則必須解決噪音、墜落、隱私及空域衝突。
低空經濟與AI的關係不只在自動駕駛。飛行器必須即時辨認建築、電線、鳥群、氣象和其他飛行器,也要計算路徑、電量與緊急降落位置;城市還需要一套能同時管理大量飛行器的低空交通系統。
六、宇樹與眾擎:機器人格鬥走紅之後
談到中國人形機器人,最近受到矚目的兩家公司是宇樹科技Unitree與眾擎機器人EngineAI。
宇樹的G1曾出現在人形機器人格鬥展示中,可以拳擊、踢擊、承受碰撞,並在跌倒後起身。但相關展示主要仍由人類操作員遠端控制,不能直接解讀為機器人已能自主判斷戰術。
格鬥的技術價值主要在硬體壓力測試。一般展示可以預先安排平坦地面和固定動作,擂台卻會放大平衡、抗衝擊、關節扭力、散熱、通訊延遲及跌倒恢復等問題。機器人如果被碰一下就停機,再漂亮的舞蹈也很難證明它能進入複雜環境。
宇樹在7月取得上海科創板上市批准,計畫募資42億元人民幣,用於AI模型、新型機器人、產品研發及智慧製造基地。這表示人形機器人已經不只靠影片吸引注意,也開始接受資本市場對營收、量產、成本和售後服務的檢驗。
財務資料也呈現熱度背後的壓力。宇樹2026年第一季營收約4.23億元人民幣,年增約68%,但扣除非經常性損益後的淨利約4,000萬元,年減約53%,原因包括研發支出、銷售費用與價格競爭增加。營收仍快速成長,獲利卻開始承受壓力,正好說明上市後市場將不只觀看機器人的表演影片,也會追問它能否量產、維修與持續賺錢。
另一家眾擎推出的T800,被用於URKL人形機器人格鬥聯賽。主辦方以標準化T800機體提供軟體、本體介面、MuJoCo模擬環境、基礎訓練及部署程式,讓參賽團隊進行二次開發。這種方式有點像賽車:硬體條件接近,差異逐漸移向控制演算法、視覺、動態平衡及策略設計。
T800這個名稱很容易讓人聯想到《魔鬼終結者》,格鬥畫面也具備強烈傳播效果。但觀察時仍應區分:哪些動作由人類遠端操控,哪些由預先設定程序完成,哪些才是機器人根據感測資料自主決策。有自主演算法組別,不等於網路流傳的每一段格鬥影片都是完全自主。
目前比較適合把這些比賽看成公開壓力測試場,讓機械結構、控制系統與軟體錯誤在碰撞中快速暴露。真正進入工廠、家庭與服務場所後,長時間穩定、安全接近人類、維修成本及零件供應,才是更困難的考驗。
七、dots.tts:開源語音模型與聲音權利
dots.tts是一個約20億參數的端到端文字轉語音模型,採用連續自回歸架構,由語意編碼器、語言模型與自回歸flow-matching聲學頭組成,聲音部分建立在48kHz AudioVAE之上。官方釋出訓練、推理及微調程式碼,採Apache 2.0授權。
專案提供多種checkpoint:基礎版本方便研究與訓練;SOAR及後訓練版本偏重聲音克隆與自然度;MeanFlow蒸餾版本著重推理速度。這種分法讓使用者可以依設備與用途,在品質、速度與可調整性之間選擇。
對舞台劇demo、虛擬角色、短片旁白與多語配音而言,本地部署很有價值。角色聲音、尚未發表的劇本和錄音資料不必全部交給雲端平台,創作者也較容易保存版本與調整模型。
但是,Apache 2.0解決的是程式碼與模型授權,不等於任何聲音都能任意使用。拿真人錄音進行聲音克隆,仍涉及本人同意、聲音肖像、表演者權利與商業使用範圍。
最基本的原則應該很清楚:不使用未經同意的真人聲音冒充本人,不製造容易使觀眾誤會的發言,也要保存聲音來源與授權紀錄。
八、Sony再告Udio:從30,442到30,117,訴訟進入逐首比對階段
2024年,RIAA代表Sony、Universal與Warner等唱片公司,分別對Suno和Udio提起訴訟,指控兩家公司未經授權,大量複製受著作權保護的錄音訓練模型。
到了2026年7月,Sony又對Udio提出新的訴訟,涉及30,117首錄音。Sony原本希望把這批錄音加入2024年的既有案件,但紐約聯邦法官Hellerstein拒絕擴大原案,讓舊案維持在原來列出的333件作品。
Sony隨後另行起訴,而原本想加入舊案卻被駁回的數量,其實是30,442首。這兩個數字的關係是:30,442首是Sony原本想「加進舊案」但被法官拒絕的數量;30,117首則是被拒絕之後,Sony另外提告的新訴訟裡實際列出的錄音數。
Sony表示,其在證據開示後透過音訊指紋比對,另行主張更多可能被使用的錄音。這一步使爭議由概括推測進入逐首辨認、比對資料與計算損害的階段。
Sony要求法院阻止進一步使用,並主張每一件故意侵權作品最高可求償15萬美元。但這些仍是原告的指控與請求,不代表法院已認定這些作品全部構成侵權。
我對這類訴訟的看法,比較不傾向把它簡化成傳統唱片公司打壓新科技,或AI公司必然掠奪音樂人。這是兩套產業制度第一次大規模碰撞:傳統唱片公司掌握錄音版權、通路與授權經驗,AI新創公司則希望利用大量資料訓練新型音樂工具。雙方對「學習」、「複製」、「合理使用」及「市場替代」有完全不同的解釋。
訴訟初期互相指控,未必完全是壞事。法院程序會迫使雙方提出資料、說明訓練方法,並逐步釐清權利範圍。只要不是彼此告到公司崩盤,或雙方堅持永不談判,這些案件反而可能幫助產業建立較明確的收費與責任標準。
將來需要回答的問題包括:訓練模型是否要事前取得授權?費用依錄音數量、使用次數、模型營收或生成次數計算?詞曲作者、唱片公司、歌手、樂手和製作人如何分配?聲音肖像是否另計?使用者生成內容發生侵權時,由平台、模型公司還是使用者負責?
和解陣營目前也比先前清楚。Universal Music Group已於2025年10月與Udio和解,並合作開發採用授權音樂的新平台;Warner則在同年11月先後與Udio、Suno解決訴訟並建立授權合作。就Udio案件而言,目前主要仍由Sony繼續追究。
這些發展說明,告上法院與談合作並不衝突。先以訴訟確立談判位置,再建立授權模型,也可能是新舊產業磨合的一部分。
理想結果不是任何一方消滅另一方,而是讓AI音樂公司取得可負擔、可計算的資料授權,讓原有權利人得到合理補償,也讓獨立創作者不必在模糊條款中承擔全部風險。
歐洲方面,德國音樂著作權集體管理組織GEMA控告Suno的案件,預定於2026年7月31日由慕尼黑地方法院宣判。截稿時判決尚未公布,因此只能把它列為下一個觀察點,不能預先宣稱法院已認定AI音樂訓練必須取得授權。
九、Suno外洩事件:訓練資料不能只用「公開資料」交代
前幾期曾經從作品分類與創作工作流介紹Suno和Udio;這一次要談的不是它們能不能生成歌曲,而是Suno遭入侵事件發生後,AI音樂平台的訓練資料來源與資料保護責任,被更具體地攤到檯面上。
根據404 Media取得相關資料後,由The Verge、Pitchfork等媒體跟進的報導,外洩的程式碼與資料中,出現從YouTube Music、Deezer、Genius、Pond5、Jamendo、Freesound及IMSLP等網站或素材平台擷取內容的指令。
目前這些內容仍屬於媒體根據外洩資料所進行的調查與報導,不代表法院已經認定Suno使用上述來源訓練模型,也不能直接推論所有被擷取的內容都構成侵權。但事件確實讓原本相當抽象的「公開可取得資料」,開始出現可以被檢查和追問的具體來源。
Suno方面表示,外洩內容主要是已經過時的原始碼,並否認完整信用卡資料及敏感個人資訊遭到洩漏;平台的付款程序也由Stripe等第三方支付業者處理。這些說法仍需要配合後續調查判斷,但事件已經提醒使用者:AI平台不只是生成工具,同時也是程式、作品與個人資料的保管者。
真正需要釐清的問題是,「在網路上公開」,是否就等於「可以大量擷取並用來訓練商業模型」?
一首歌可以在網站上播放,不代表網站條款允許其他公司大量下載;使用者可以閱讀歌詞,也不表示這些歌詞能直接被納入商業模型;素材庫允許下載或在特定作品中使用,也不等於原有授權必然包括AI訓練。公開瀏覽、平台授權、著作權與模型訓練,其實是不同層次的權利關係,不能只用「資料原本就在網路上」一句話全部帶過。
另一方面,AI音樂平台也保存使用者上傳的音樂、聲音、歌詞、提示詞、生成紀錄與帳號資料。對創作者而言,這些內容可能包括尚未發表的作品、角色聲線、商業企畫及個人創作方法。因此,平台除了應該說明外部訓練資料從哪裡取得,也應讓使用者知道:上傳內容是否會被用於模型訓練、資料保留多久、能否選擇退出、刪除帳號後如何處理,以及發生資安事件時將以什麼方式通知。
Suno事件的影響不只在於某批程式碼是否過時,也不只是追查模型究竟抓取過哪些網站。它更重要的提醒是:AI音樂平台要取得長期信任,不能只證明自己能快速生成歌曲,也必須更清楚地交代訓練資料、使用者作品與平台安全。
生成品質可以吸引使用者加入,但資料來源是否合理、創作內容能否受到保護,以及事故發生後平台是否誠實說明,才會決定使用者願不願意長期留下。
十、本期免費工具:video-autopilot-kit
這一期最後介紹的免費工具,是駱君昊Hao0321公開在GitHub上的video-autopilot-kit。
它不是新型影片模型,而是一套YouTube與短影音製作框架。專案把頻道設定、素材、字幕、B-roll、背景音樂、字型、輸出與品質檢查拆成不同部分,再讓使用者填入自己的資料。公開版本不包含作者私人內容,採MIT授權,可依需求修改。
它提供兩條使用路線。第一條是Python加ffmpeg的程式化流程,可以在Windows、macOS與Linux執行,不必安裝CapCut,適合大量、規格固定的影片。
第二條是CapCut-assisted流程,利用CapCut Desktop草稿JSON、模板及相關自動化,把程式處理後的內容接入剪輯軟體。這條路線較接近一般創作者熟悉的介面,但會受到CapCut版本變動影響。
第一次安裝時,Windows使用者可能遇到Git、Python或pip未安裝,winget安裝後終端機沒有重開,或中文資料夾與壓縮檔名稱造成解壓縮亂碼等問題。較穩妥的方法是安裝新工具後關閉並重開終端機,資料夾名稱盡量使用英文,必要時改用7-Zip解壓縮。
實際建立專案時,還要準備影片素材、背景音樂、字型、B-roll與輸出資料夾,再確認config.py中的專案路徑。這些步驟不如一鍵生成吸引人,卻是把剪輯流程穩定下來必須處理的細節。
最近另一個受到注意的發展,是開源專案video-use開始把Claude Code、Codex等程式代理人直接變成影片剪輯助手。使用者把原始素材放進資料夾,再以自然語言說明需要的影片形式,系統便能根據逐字稿與時間碼刪除贅字、停頓和失敗片段,加入字幕、基本調色及動畫圖層,最後輸出完成影片。它也支援HyperFrames、Remotion與Manim等程式化影像工具,並在輸出前檢查剪接點可能出現的跳格、爆音與字幕問題。
第33期曾經談過Claude Code、Codex與FFmpeg組成影音工作流;video-use代表這個方向又往前走了一步:過去需要創作者自己設計許多程式與流程,現在則開始被整理成可以安裝、重複使用的Skill。不過,它仍需要FFmpeg、語音轉錄、API與本地環境設定,也不能完全取代創作者對節奏、內容與畫面取捨的判斷。
十一、結語:開始計算成本、責任與落地能力
回頭看這幾個月的發展,從DeepSeek與Kimi的路線競爭、生成式影音由單一模型走向Google Flow等製片工作流、COMPUTEX對推理成本的重新計算,到低空經濟逐漸法規化、宇樹面臨的獲利壓力,以及Sony對Udio訓練資料的逐首比對,AI產業正在補上早期高速發展時暫時擱置的問題:運算由誰負擔、資料從哪裡取得、作品權利如何分配、機器發生事故由誰負責,以及一項技術能否穩定運作,而不是只完成一次令人驚訝的展示。
接下來仍會有更大的模型、更漂亮的影片和更靈活的機器人。但企業若不能控制成本、處理授權、保護資料並建立可靠服務,再好的技術展示也很難形成可以長期維持的產業。
AI發展的早期階段,證明了文字、聲音、影像與程式等許多內容都可以生成;現在開始的新階段,則要進一步證明這些技術能否被社會安全、合理而長久地使用。
附錄:官方文件、新聞資料與軟體網址
以下網址查核日期為2026年7月28日。優先列出官方產品、模型、文件與下載頁;訴訟及產業消息則補充具查證責任的新聞來源。部分網站可能設有地區限制、登入要求或訂閱牆。
一、DeepSeek V4/Kimi K3
DeepSeek V4 Preview官方發布
DeepSeek V4 Pro模型卡、技術報告與權重
DeepSeek V4開放模型合集
DeepSeek官方API定價
Kimi K3官方技術文章與展示
Kimi官方產品入口
Kimi API開放平台
Transformer-XL論文
XLNet論文
OpenRouter模型與價格比較
二、生成式影音與Google Flow
ByteDance Seed模型與Seedance官方資料
Google Flow官方產品入口
Google:Veo 3.1與Flow功能更新
Google:Gemini Omni官方介紹
Runway Aleph 2.0與Edit Studio
Synthesia 3.0官方介紹
Moonvalley Marey官方模型頁
三、COMPUTEX、Intel、Qualcomm與NVIDIA
COMPUTEX TAIPEI官方網站
Intel COMPUTEX AI創新官方發布
Qualcomm/ASUS Ascent QN10官方資料
NVIDIA GTC Taipei/COMPUTEX官方頁
四、Alphabet AI資本支出
Alphabet投資人關係官方入口
Reuters:Google上調2026年資本支出
五、中國低空經濟
Reuters:中國修訂民航法、納管無人機
CGTN:中國低空經濟從示範走向營運
六、宇樹、眾擎與機器人格鬥
宇樹Unitree官方網站
Unitree G1官方產品頁
眾擎EngineAI官方網站
EngineAI T800官方產品頁
URKL官方競賽規則
URKL模型、程式與選拔資料
Reuters:宇樹上海科創板IPO
Reuters Breakingviews:宇樹營收與獲利壓力
2026年7月16日深圳URKL揭幕戰完整影片(媒體上傳,非主辦方官方頻道)
七、dots.tts
dots.tts官方GitHub與安裝說明
dots.tts技術報告
dots.tts模型下載合集
八、Sony、Udio、Suno與AI音樂版權
RIAA:2024年Suno與Udio訴訟官方說明
Music Business Worldwide:Sony新案列出30,117首錄音
Music Business Worldwide:法院拒絕加入30,442首錄音
Universal Music Group與Udio官方和解公告
Warner Music Group與Udio官方合作公告
Reuters:Warner與Suno和解及授權模式
九、Suno外洩與訓練資料
The Verge:Suno外洩與訓練資料來源
Pitchfork:Suno遭入侵及資料來源報導
Suno官方網站
十、免費工具與安裝資料
video-autopilot-kit官方GitHub
video-use官方GitHub
Git for Windows
Python for Windows
FFmpeg
7-Zip
CapCut Desktop
資料與連結說明
本文所列官方網站、新聞報導、技術文件及軟體下載連結,均依截稿前的公開網路資料整理。部分中國大陸網站可能因地區限制、網路環境、平台登入要求、頁面調整或網址更新而暫時無法開啟;各項模型規格、服務價格、產品版本及訴訟進度,也可能在文章刊出後有所變動。
讀者若遇到連結失效,可依文中所列的公司、產品、文件或新聞標題重新搜尋,並以相關機構最新發布的官方公告與現行網址為準。文中連結僅供延伸閱讀及資料查核使用,不代表對相關產品、服務或第三方主張的背書。





留言