字节跳动(ByteDance)将同时处理语音、视频和文本的双向AI模型SeedRealtime应用于抖包(Doubao)应用。AI研究组织Seed于10日公开了SeedRealtime。该模型将音频、视频和文本整合为端到端结构,并能够并行处理识别、理解、判断和表达。SeedRealtime支持在用户讲话结束前接收输入,并判断对话流,具备双向交互功能,同时在模型内部包含了对话轮次转换功能,取代了外部语音活动检测器(VAD)。根据字节跳动内部评估,对话节奏问题比现有的级联结构减少了一半。该模型是4月发布的双向语音模型Seeduplex功能的扩展,Seeduplex在复杂噪声环境中将错误响应率和错误中断率降低了一半。用户犹豫时,AI先插入的比例减少了40%,对话流畅性指标提高了12%。然而,此次发布与加密货币和区块链市场的直接关联尚未得到确认。字节跳动公开的内容中并未包含代币发行或区块链网络联动计划。
本内容仅供参考,不构成任何金融、投资、法律或税务建议。文中提及的任何活动、奖励、线上活动或相关信息,不应被视为对购买、出售或交易任何加密资产的推荐、招揽或邀请。加密资产具有高波动性,存在价值损失风险。WEEX服务、产品及相关活动的可用性可能因地区而异。用户在参与前有责任确保符合当地适用法律法规。











