OpenAI 推出实时语音 API 公测版
OpenAI 推出实时语音 API 公测版,支持低延迟流式语音对话、中断响应与函数调用,集成六种自然声音;同步在 Chat Completions API 中新增音频输入输出能力。开发者可用单一接口构建多模态对话体验,适用于教育、客服、辅助功能等场景。
解锁 Runway Gen-3 视频风格迁移新玩法
Runway Gen-3 新增视频风格迁移功能,实拍手影戏等素材可一键转为动画风格,操作简单、无需专业技能,显著降低AI动画创作门槛。
AI 眼镜 I-XRAY 引发隐私担忧
AI眼镜I-XRAY可实时识别人脸并从公开网络抓取住址、电话等隐私信息,技术本身并不复杂,却暴露了当前人脸识别、LLM与公共数据库结合带来的现实风险。开发者强调其初衷是警示而非滥用,并提供PimEyes等平台的信息删除指南。
两分钟讲述人类利用技术讲故事的历史
Runway发布2分钟短片,梳理从洞穴壁画、手抄本、印刷术到电影、电视、互联网及AI生成内容的叙事技术演进。视频指出,技术形态持续更迭,但人类对故事的本质渴求始终如一,也由此引出对下一代叙事方式的思考。
最新 AI 视频制作工作流
新AI视频工作流整合Magnific Mystic v2(图像更逼真高清)、ChatGPT-4o Advanced Voice(情感化语音合成)与可灵1.5(单次生成60秒口型同步视频),实现高拟真、强情感的端到端视频创作,适合需快速产出高质量对话类视频的创作者。
Pika 1.5 视频特效演示
Pika 1.5上线六种趣味物理特效:充气、融化、爆炸、压扁、压碎和蛋糕化,可对生成视频进行直观可控的风格化变形,让AI视频编辑更富表现力与创意空间。
Pika 1.5 发布,一键生成 6 种特效
Pika 1.5 正式发布,新增充气、融化、爆炸、压扁、压碎、蛋糕化六种一键视频特效,大幅降低创意视频制作门槛,让普通用户也能轻松实现趣味动态效果。
四大 AI 视频生成工具对比
以“巴塔哥尼亚冰川全景”为统一提示词,实测Runway Gen-3、可灵1.5、Luma Dream Machine与海螺AI四款主流工具:重点比对构图合理性、秃鹫与企鹅的动态表现、云隙光等光影细节,以及冰蓝与暗影的色彩还原能力。
AI 音乐视频:《人类的幽灵》
AI生成音乐短片《人类的幽灵》,以自然反噬人类的末日图景,探讨发展与保护的失衡之痛。MidJourney绘图、Runway生成视频、Suno作曲,全链路由AI协作完成,落脚于“平衡才是可持续未来的唯一路径”。