• SlideChat  上海AI Lab联合多所高校和机构推出的视觉语言助手

    SlideChat 上海AI Lab联合多所高校和机构推出的视觉语言助手

    184

    SlideChat是上海AI实验室、厦门大学、华东师范大学等机构推出的,首个能理解千兆像素级别全切片图像的视觉语言助手。SlideChat能生成详尽的全切片图像描述,并针对多样化的病理场景提供具有上下文关联的复杂指令响应。基...

  • 书生InternThinker  上海 AI Lab 推出的强推理模型

    书生InternThinker 上海 AI Lab 推出的强推理模型

    227

    书生InternThinker是上海人工智能实验室推出的强推理模型,具备自主生成高智力密度数据和元动作思考能力。基于长思维能力和自我反思、纠正机制,在数学、代码、推理谜题等多种复杂任务上表现出色。模型用通专融合技术,基于大规...

  • MCP  Anthropic 开源的模型上下文协议

    MCP Anthropic 开源的模型上下文协议

    290

    MCP(Model Context Protocol,模型上下文协议)是一个开放协议,是Anthropic开源的,能实现大型语言模型(LLM)应用与外部数据源和工具之间的无缝集成。基于客户端-服务器架构,支持多个服务连接到任...

  • LEOPARD  腾讯AI Lab西雅图实验室推出的视觉语言模型

    LEOPARD 腾讯AI Lab西雅图实验室推出的视觉语言模型

    238

    LEOPARD是腾讯AI Lab西雅图实验室推出的视觉语言模型,专为理解和处理含有大量文本的多图像任务设计。LEOPARD基于两个主要技术创新:一是策划约一百万条专门针对文本丰富、多图像场景的高质量多模态指令调优数据集;二是...

  • LazyGraphRAG  微软推出的图形增强生成增强检索框架

    LazyGraphRAG 微软推出的图形增强生成增强检索框架

    206

    LazyGraphRAG是微软研究院推出的图形增强生成增强检索(RAG)框架,是GraphRAG的迭代版本。LazyGraphRAG在数据索引成本上大幅降低,是GraphRAG的0.1%,同时用新的混合数据搜索方法,提高生成...

  • Kandinsky-3  开源的文本到图像生成框架,适应多种图像生成任务

    Kandinsky-3 开源的文本到图像生成框架,适应多种图像生成任务

    209

    Kandinsky-3是基于潜在扩散模型的文本到图像(T2I)生成框架,以高质量和逼真度在图像合成领域脱颖而出。Kandinsky-3能适应多种图像生成任务,包括文本引导的修复/扩展、图像融合、文本-图像融合及视频生成等。研...

  • CAVIA  苹果、得克萨斯、谷歌联合推出的多视角视频生成框架

    CAVIA 苹果、得克萨斯、谷歌联合推出的多视角视频生成框架

    179

    CAVIA是苹果公司、得克萨斯大学奥斯汀分校、谷歌联合推出的多视角视频生成框架,能将单一输入图像转换成多个时空一致的视频序列。框架基于引入视角集成注意力模块,增强视频的视角一致性和时间连贯性,支持用户精确控制相机运动,同时保...

  • Flex3D  Meta GenAI和牛津大学共同推出的两阶段3D生成框架

    Flex3D Meta GenAI和牛津大学共同推出的两阶段3D生成框架

    188

    Flex3D是由Meta的GenAI团队和牛津大学研究团队推出的创新的两阶段3D生成框架,能基于任意数量的高质量输入视图,解决从文本、单张图片或稀疏视图图像生成高质量3D内容的挑战。第一阶段,基于微调的多视图和视频扩散模型生...

  • EvolveDirector  阿里联合南洋理工推出文本到图像生成模型的高效训练技术

    EvolveDirector 阿里联合南洋理工推出文本到图像生成模型的高效训练技术

    202

    EvolveDirector是阿里巴巴和南洋理工大学联合推出的创新框架,用公开资源和高级模型的API接口训练一个高性能的文本到图像生成模型。框架基于与现有高级模型的API交互获取数据对,训练一个基础模型,并借助预训练的大型视...

  • StoryTeller  字节、上海交大、北大共同推出的全自动长视频描述生成一致系统

    StoryTeller 字节、上海交大、北大共同推出的全自动长视频描述生成一致系统

    223

    StoryTeller是字节跳动、上海交通大学和北京大学共同推出的系统,能基于音频视觉角色识别技术改善长视频描述的质量和一致性。系统结合低级视觉概念和高级剧情信息,生成详细且连贯的视频描述。StoryTeller由视频分割、...

23 24 25 26 27 28 29 30 31 32
返回顶部 暗黑模式