
如何构建 AI 扩展定律以实现高效 LLM 训练和预算最大化
MIT-IBM 团队发布大规模语言模型扩展定律系统性指南,通过分析 485 个模型和 190 万条性能指标,拟合超 1000 条扩展定律。研究发现预测相对误差最佳可控制在 4%,并证实小模型与大模型存在可迁移规律。建议优先训练多个小模型而非追求大模型,中期检查点数据最具预测价值。这项研究为资源受限的研究者提供了更公平参与大模型研究的可能,揭示了扩展定律在跨模型家族间的通用性。

HumanX 大会: Claude 成为全场焦点
本周在旧金山 HumanX AI 大会上,智能体式 AI(Agentic AI) 成为焦点。 Anthropic 的 Claude 凭借良好口碑在开发者社区迅速崛起, OpenAI 虽获 1220 亿美元融资,却因战略摇摆和舆论争议受到质疑。智能体编程正快速改变软件工程领域,两家 AI 巨头竞争激烈, OpenAI 推出新订阅服务争夺编程工具市场。这场 AI 竞赛格局正在重塑,谁能真正解决用户核心痛点,谁就能在智能体时代占据主动。

从 LLMs 到“幻觉”,一文搞懂常见 AI 术语
本文系统梳理了人工智能领域的核心术语框架,涵盖 AGI 定义、智能体、神经网络、深度学习、大语言模型、扩散模型等关键技术概念,并解读了蒸馏、微调、幻觉、算力等产业实践要素。文章揭示 AI 产业飞速发展与概念定义尚未收敛的矛盾,指出记忆危机与算力瓶颈正从基础设施层面重塑竞争格局,理解概念本质比背诵定义更为重要。

特朗普官员据悉鼓励银行测试 Anthropic 的 Mythos 模型
美国财长与美联储主席召集华尔街银行高管,推动部署 Anthropic 公司新 AI 模型 Mythos 用于安全漏洞筛查。摩根大通已获优先权,高盛等大行正测试。 Anthropic 限制访问规模,模型虽未经专门安全训练,探测精准度却超预期。同时 Anthropic 正与特朗普政府因国防部将其列入供应链风险名单而陷入司法角力,英金融监管机构也在评估该模型风险。此事件折射出 AI 治理权归属的深层争议。

Anthropic 正在测试 Claude Code 的升级版本,旨在与 Codex 超级应用竞争
Anthropic 正在推进 Claude Code 桌面端代号“Epitaxy”的重大升级。新版界面集成 Plan 面板、任务追踪、代码 Diff 等功能,支持多仓库操作与实时预览。同时推出 Coordinator Mode , Claude 担任编排者角色向并行子智能体分配任务,采用本地优先架构以适应隐私敏感场景。 Anthropic 与 OpenAI 下周均将发布桌面端更新,双方竞争焦点已从模型基准测试转向实际使用场景的深度渗透。

Nano Banana 2 :融合 Pro 级性能,闪电般极速
Google DeepMind 发布 Nano Banana 2 图像生成模型,将专业级能力与极速响应合二为一。核心升级包括继承 Pro 版的世界知识与文本渲染技术,同时具备闪电般的生成速度。技术亮点涵盖精准对象渲染、信息图表与数据可视化、主体一致性支持 5 角色 14 对象、复杂指令理解及 512 像素至 4K 分辨率输出。该模型现已集成至 Gemini 、 Google 搜索等多平台,并强化 SynthID 溯源技术。这标志着生成式 AI 图像领域专业工具的加速普惠。

衡量迈向通用人工智能的进展:认知框架
Google DeepMind 发布基于认知科学的 AGI 评估框架,将通用智能分解为感知、学习、推理等 10 项核心认知能力,并设计三级评估协议将 AI 与人类能力对标。同步启动 Kaggle 黑客松竞赛,总奖金 20 万美元。该框架标志着 AGI 评估从“能力展示”转向“认知溯源”,但认知能力边界界定等挑战仍待解决。
Zephyr 机甲 K-pop 系列剧第一集完整版
Zephyr 机甲 K-pop 系列首集正式上线,不仅呈现五位能打能唱的机甲女神,更引入机械师 Kai 的故事线与首个 Boss 级怪兽。这部由 AI 打造的动画在视觉表现上极具冲击力,制作水准不亚于《环太平洋》。

Sam Altman 回击《纽约客》争议报道,此前住所被袭
OpenAI CEO Altman 位于旧金山的住宅遭燃烧弹袭击,警方在其总部逮捕嫌疑人。袭击前,《纽约客》发表长文批评 Altman 是“近乎偏执的权力追逐者”。 Altman 随后发博客承认自己“回避冲突”的性格带来诸多问题,向被伤害者致歉,同时呼吁行业降低对抗性。该事件折射出 AI 行业对“控制 AGI”的偏执渴望。当技术权力被神话化,冲突似乎难以避免。