2026年07月16日
第03版:综合

生数科技发布ViduS1推动视频生成迈向“实时交互”

□本报记者 赵磊

近日,在2026全球数字经济大会人工智能融合应用发展论坛上,来自海淀的人工智能企业生数科技正式发布面向实时交互场景的新一代模型——ViduS1实时交互模型。大会期间,北京软件和信息服务业协会(BSIA)正式发布《2025年北京市数字经济标杆企业评价报告》,生数科技凭借在技术创新与产业应用方面的突出表现,成功入选“新模式新应用标杆企业”。

让数字人真正“听懂”用户

生数科技创始人朱军介绍,ViduS1实时交互模型,提供实时可交互的新一代视频生成能力,推动AI视频从“生成一段内容”,迈向“持续进行互动”。模型支持实时视频通话和语音控制视频走向,用户不仅能通过语音控制数字人的行为,还能实现无限时长连续互动。同时,ViduS1支持540P(960x540)高清分辨率、25FPS帧率(最高支持42FPS),可基于真人、动漫、萌宠等任意初始形象及个性化音色,快速创建专属交互角色,为用户带来更自然、更流畅、更具沉浸感的实时互动体验。

ViduS1可以让用户在视频通话过程中持续输入语音,模型则结合语音内容、对话上下文和当前画面状态,实时生成角色的后续内容和动作。ViduS1采用实时视频生成技术,将语音从驱动嘴型的音频信号,升级为控制角色视觉行为的实时指令。模型不仅能够生成与语音同步的口型,还能理解语义、意图与情绪,实时生成相匹配的表情、眼神、手势、身体姿态及全身动作,让数字人从“会说话的虚拟形象”,进化为能够理解用户、即时回应并持续互动的生成式角色。

让视频在互动中持续演化

ViduS1采用自回归扩散模型路线,不再一次性生成完整视频,而是基于已经生成的历史画面,结合当前语音指令和对话上下文,持续预测并生成后续内容。当用户发出新的语音指令时,模型可以实时理解并调整角色的表情、动作及后续视频走向,使视频从预先确定的固定内容,转变为一个持续生成、实时响应、动态演化的交互过程。除了交互式实时生成,ViduS1还首次实现了无限时长的实时视频生成。即使连续生成数小时,画面仍能保持稳定,不会漂移或崩坏。

实现长时间连续互动,仅仅“持续生成”还不够。模型还需要在长时间运行中同时保持角色身份稳定、动作自然连贯,并能够持续接收用户指令、实时做出响应。ViduS1既能在长时间生成中保持角色形象稳定、动作自然连贯,也能持续接收用户语音指令并实时作出响应,率先实现无限时长的生成式视频互动。

一张图可创建实时交互角色

ViduS1采用纯生成式技术路线,无需针对每个角色进行离线建模和训练。用户只需上传一张初始图片,模型即可理解角色的身份、外观和视觉风格,并实时生成角色的口型、表情、动作和身体姿态。无论是真人、动漫角色还是萌宠形象,都可以快速转化为可实时互动的生成式角色。同时,ViduS1支持自定义音色,实现视觉形象与声音身份的统一。

ViduS1的发布,让视频不再只是预先生成、离线观看的固定内容,而成为能够理解指令、实时响应并持续演化的交互载体。朱军表示,未来,ViduS1可广泛应用于AI情感陪伴、AI虚拟偶像、互动直播、游戏NPC、品牌数字人、智能客服、在线教育及XR等场景,推动数字角色从一次性内容资产,升级为长期在线、持续互动的智能入口。

2026-07-16 6 6 海淀报 c63309.html 1 生数科技发布ViduS1推动视频生成迈向“实时交互” /enpproperty-->