DeepSeek 发布开源多模态模型 Janus Pro 7b,可本地部署

DeepSeek 开源多模态模型 Janus Pro 7B,基于 DeepSeek V2 构建,支持图像理解与生成,训练数据超9000万样本(含7200万合成美学数据),采用自回归Transformer架构,集成文本编码器与图像解码器,可通过 Hugging Face 或 GitHub 免费获取,支持 FAST API 与 Gradio 本地部署。

发布于2025年1月29日 07:49
编辑零重力瓦力
评论0
阅读80

国外 AI 技术达人 Mervin Praison 讲解 DeepSeek 最新开源多模态模型:Janus Pro 7B,拥有比 LLaVA 等其他开源多模态模型更加卓越的性能。

功能亮点

  1. 基于 Deep Seek V2 构建,使用超过 9000 万训练样本,以及先进的合成美学数据训练(7200 万样本),不仅能够理解图像,还能生成图像。
  2. 支持 FAST API 和 Gradio
  3. 向公众免费开放,可通过 Hugging Face 获取,附完整文档!

技术规格

  1. 自回归 Transformer 架构
  2. 拥有文本编码器、标记器、图像解码器等组件
  3. 训练数据包含:图像、字幕、表格、图表、文档分析

应用场景

  1. 详细场景描述
  2. 地标识别
  3. 文本识别
  4. 图像生成
  5. 常识问答
  6. 视觉小说创作

下载地址:https://github.com/deepseek-ai/Janus

总之,DeepSeek Janis Pro 7B 不仅提供了国外顶尖闭源多模态模型的功能,而且免费开源,相当良心!

相关文章

GPT-6 Astra 驱动本地 Blender 建模,从一句话直接生成可编辑工程文件
AI 编程开发
2026年9月14日
0 条评论
小创

GPT-6 Astra 驱动本地 Blender 建模,从一句话直接生成可编辑工程文件

AI 编程智能体可通过调用本地 Blender Python 接口,将自然语言转化为可编辑的 3D 工程文件,实现从文生图到图生 3D 的生产力突破。该模式支持渐进式迭代与技能固化,解决了传统生成模型不可二次编辑的痛点。但受限于无实时视口反馈,智能体在复杂拓扑与空间对齐上仍存盲区,需依赖视觉回检闭环规避风险。未来演进方向为接入多模态感知系统,以实现更精准的 3D 内容创作。

#AI工具#智能体#3D建模
阅读全文
IP as Logo 斩获五千星,智能体技能让极简吉祥物生成可复现
AI 产品工具
2026年9月14日
0 条评论
小创

IP as Logo 斩获五千星,智能体技能让极简吉祥物生成可复现

开源项目 ip-as-logo-skill 将品牌 IP 生成转化为标准化智能体技能,通过几何约束与复杂度预算,确保吉祥物在 32x32 像素下清晰可辨。该方案支持上下文反推工作流,兼容主流 Agent 环境并提供免费商用素材库,使 Logo 设计从无序抽卡变为可复现的工程化流程。其优势在于提供稳定极简的视觉下限,适合工具类产品与初创团队,但美学上限受限且依赖模型指令遵循度,暂无法替代专业品牌设计。

#Agent Skills#图像生成#AI工具
阅读全文
ChatGPT Images 2.5 实战指南,教你用 Sunburst 与 Flare 实现像素级保真编辑
AI 教程知识
2026年9月14日
0 条评论
小创

ChatGPT Images 2.5 实战指南,教你用 Sunburst 与 Flare 实现像素级保真编辑

OpenAI 发布 ChatGPT Images 2.5,推出 Flare 与 Sunburst 双模型架构。Flare 延迟降低 50%,适合快速生成;Sunburst 专注像素级精准编辑与多图融合。新版支持 Images 与 Responses 两类 API 管道,并新增草图、模板及定点批注等原生交互功能。该版本确立了图像生成的工业级确定性标准,要求采用结构化提示词思维。尽管局部保真度显著提升,但超高密度微缩文字排版仍需后期人工复核。

#AI工具#AI绘画#图像生成
阅读全文
互动讨论

评论区

围绕《DeepSeek 发布开源多模态模型 Janus Pro 7b,可本地部署》展开交流,未登录用户可浏览评论,登录后可参与讨论。

评论数
0
登录后参与评论
支持发表观点与回复一级评论,互动后将同步到消息中心。
登录后评论
暂无评论,欢迎成为第一个参与讨论的人。