可靈2.6模型推出「音畫同出」能力 重構AI影片創作工作流
香港2025年12月5日 /美通社/ — 領先的內容社群及社交平臺快手科技(「快手」或「公司」;港幣櫃臺股份代號:01024 / 人民幣櫃臺股份代號:81024)宣佈,12月3日,可靈推出影片生成2.6模型,該模型提供了里程碑式的「音畫同出」能力,徹底改變了傳統AI影片生成模型「先無聲畫面、後人工配音」的工作流程。它能夠在單次生成中,輸出包含自然語言、動作音效以及環境氛圍音的完整影片,重構了AI影片創作工作流,極大提升創作效率。 重構AI影片創作工作流 中文語音生成效果全球領先 可靈2.6模型升級了文生音畫、圖生音畫兩大功能,輸入文字或是輸入圖片結合提示詞文字,均可直接生成帶有語音、音效及環境音的影片。語音當前支援生成中文以及英文,生成影片長度最長支援10秒。 該升級重構了傳統AI影片創作「先生成無聲的影片,再結合其他軟體完成後期聲音製作」的工作流,創作者使用可靈2.6模型,能夠直接生成包含人聲、環境與效果音效的影片,極大提升了創作者的工作效率。 透過對物理世界聲音與動態畫面的深度語義對齊,可靈2.6模型在音畫協同、音訊質量和語義理解上表現亮眼。 音畫協同上,可靈2.6模型生成的影片,在語音節奏、環境音與畫面動作上緊密呼應,實現了對畫面動態與聲音節奏的深度對齊,避免了傳統工作流可能產生的「畫面一套、聲音一套」的割裂體驗。 音訊品質上,在支援人聲、音效、環境聲等多型別聲音生成的基礎上,生成的音訊音質更乾淨、層次更豐富,整體聽感更接近真實的混音效果,滿足專業級創作對聲音細節的高要求。 語義理解上,該模型對多種場景下的文字描述、口語表達和複雜劇情有較強的語義理解能力,能夠更準確地把握創作者意圖,從而輸出邏輯更嚴密、更貼合用戶需求的音畫內容。同時,可靈2.6模型在中文語音生成效果上保持全球領先。 一鍵「音畫同出」…
閱讀更多