选择或上传你的照片 → 生成后自动和TA拼成同框合舞
实时查看 step-2200 LoRA 对 2371 条数据重新 rollout 的结果。每条使用 16 次 DiT,并展示最终 VAE 解码视频、Reference 条件、完整 Prompt 和生成信息。
结果持续从四台训练节点解码;视频使用 24fps 并保留 H3 生成音频。
Describe the outcome. Add the media that matters. The agent interprets your intent, preserves visual continuity, and builds a production-ready plan.
给一点素材和模糊偏好,我们先替你走向几个完全不同的方向。看完成品,再决定选哪个、混什么、改哪里。
不必写完整 Brief,一句话和一张图就够了。
正在理解产品里真正值得被记住的部分…
选择一个主方向,或从不同方案里拿走你喜欢的部分。这里的反馈会成为下一轮创意的真正 Brief。
交互原型:下一步可接入创意模型与真实 T2V Prompt 编译服务
选择一个 LoRA 后,共用样例音频、文本克隆 TTS 和文章演绎能力。
按原视频时间轴逐段生成;每一段都固定使用当前选择的 First Frame,避免生成误差逐段累积。前三段完成后自动播放。
按 E01 顺序音频逐段生成;每一段都固定使用当前选择的 First Frame,避免人物和画质逐段衰减。前三段完成后自动播放。
直接粘贴一篇文章;服务按完整语义切段(目标 74 字、最多 80 字)、逐段合成克隆语音,再沿用同一条 24fps 伪流式 A2V 管线生成完整视频。
选择 H3、4090 上的 LTX 2.5,或用同一个 Prompt 同时生成两路视频并排对比。
“当前可接单”仅统计健康、空闲且未被维护锁定或隔离的槽位;注册数量不等于服务容量。
V4 Flash 负责下一句口播,四张 H200 同时生成对应画面与人声;没有新消息时会自然延续直播。
从真实训练缓存中抽一句语音,直接比较原音频、VAE 上限与 latent 随机扰动结果。
训练数据中的原始归一化语音。
不加扰动,用来单独观察 Audio VAE 上限。
Time-shared,Gaussian,noise seed 42。
输入文字后,由官方 DiffInk checkpoint 生成带字形和笔顺时序的在线笔迹,再渲染成逐笔书写动画。