Anthropic 推出 网页版 Claude Code
Anthropic 推出网页版 Claude Code(Beta),支持浏览器内并行处理多编码任务,运行于隔离沙盒环境;可直连 GitHub 自动创建 PR 并生成变更摘要。同步上线 iOS 版,目前仅限 Pro 与 Max 用户试用。
企业如何使用新的 AI 技术
Anthropic CEO Dario 与礼来CIO Diogo 对谈指出:企业应用AI须以事实准确性与可验证性为前提,尤其在医药等高风险领域;不应止步于局部流程优化,而要前瞻性重构业务;技术无需“完全成熟”即可启动部署,在迭代中抢占变革先机。
Google AI Studio 引入 Annotation(注释模式)
Google AI Studio 新增可视化注释模式,用户可直接点击界面元素(如按钮、文字)添加标注,后续修改由 Gemini 自动完成,显著降低应用迭代门槛,提升前端调整效率。
能够有效避免 LLM 产生幻觉的智能体框架 Parlant
Parlant 是一款专为抑制大模型幻觉设计的智能体框架,提出注意力推理查询(ARQ)方法:通过 JSON 结构化模板强制模型在每步推理中回答规则约束、历史操作、工具调用等关键问题,使长对话中的规则遵循率提升至 90.2%,显著优于思维链,在复杂流程与多轮交互中更稳定可靠。
DeepSeek 发布了一款超强的开源 OCR 模型:DeepSeek-OCR
DeepSeek 开源 OCR 模型 DeepSeek-OCR 提出“文本渲染为图”新范式,用自研视觉编码器将长文档高压缩为少量视觉 Token,10 倍压缩下还原精度达 97%;支持多语言、复杂版式与图表识别,端到端输出 Markdown/HTML,兼具高效推理与泛视觉理解能力。
AI Master 对 Gemini 3.0 的预测
据网传谷歌内部文件,Gemini 3.0 或将于10月下旬发布,主打更强逻辑推理与编程能力、原生智能体操作(如订票、发邮件)、深度整合 Workspace、多模态支持(文本/图/视频),并推出超快响应的 Flash 版及 Android 本地 Nano 模型,构建覆盖多场景的 AI 生态系统。
如何通过 ElevenLabs Studio 为视频制作音效
ElevenLabs Studio 新增音效与背景音乐生成功能,可为AI生成视频自动匹配环境音、拟音和配乐,解决当前视频模型普遍缺乏声音设计的问题,让创作者一站式完成视听统一的高质量内容。
AI 创意短片《上海巨猫》Sora 15 秒免费的惊艳
Sora 2上线故事板功能,Pro用户可生成最长25秒、免费用户15秒的AI创意短片。《上海巨猫》即为15秒免费生成的惊艳示例——无需下载、无需付费,Web端直接出片,已能满足广告、预告等轻量叙事需求。
利用 Veo 3.1 把真人照片、2D 和 3D 人物巧妙融合
日本AI创作者借助Veo 3.1新增的Ingredient功能,首次实现真人照片、2D与3D人物在同一视频中自然融合,风格统一、过渡流畅,展现出模型在多源异构图像合成上的实质性突破。