科普第27页 - 中国AI网

SlideChat 上海AI Lab联合多所高校和机构推出的视觉语言助手

184

SlideChat是上海AI实验室、厦门大学、华东师范大学等机构推出的，首个能理解千兆像素级别全切片图像的视觉语言助手。SlideChat能生成详尽的全切片图像描述，并针对多样化的病理场景提供具有上下文关联的复杂指令响应。基...

227

书生InternThinker是上海人工智能实验室推出的强推理模型，具备自主生成高智力密度数据和元动作思考能力。基于长思维能力和自我反思、纠正机制，在数学、代码、推理谜题等多种复杂任务上表现出色。模型用通专融合技术，基于大规...

290

MCP（Model Context Protocol，模型上下文协议）是一个开放协议，是Anthropic开源的，能实现大型语言模型（LLM）应用与外部数据源和工具之间的无缝集成。基于客户端-服务器架构，支持多个服务连接到任...

238

LEOPARD是腾讯AI Lab西雅图实验室推出的视觉语言模型，专为理解和处理含有大量文本的多图像任务设计。LEOPARD基于两个主要技术创新：一是策划约一百万条专门针对文本丰富、多图像场景的高质量多模态指令调优数据集；二是...

206

LazyGraphRAG是微软研究院推出的图形增强生成增强检索（RAG）框架，是GraphRAG的迭代版本。LazyGraphRAG在数据索引成本上大幅降低，是GraphRAG的0.1%，同时用新的混合数据搜索方法，提高生成...

209

Kandinsky-3是基于潜在扩散模型的文本到图像（T2I）生成框架，以高质量和逼真度在图像合成领域脱颖而出。Kandinsky-3能适应多种图像生成任务，包括文本引导的修复/扩展、图像融合、文本-图像融合及视频生成等。研...

179

CAVIA是苹果公司、得克萨斯大学奥斯汀分校、谷歌联合推出的多视角视频生成框架，能将单一输入图像转换成多个时空一致的视频序列。框架基于引入视角集成注意力模块，增强视频的视角一致性和时间连贯性，支持用户精确控制相机运动，同时保...

188

Flex3D是由Meta的GenAI团队和牛津大学研究团队推出的创新的两阶段3D生成框架，能基于任意数量的高质量输入视图，解决从文本、单张图片或稀疏视图图像生成高质量3D内容的挑战。第一阶段，基于微调的多视图和视频扩散模型生...

202

EvolveDirector是阿里巴巴和南洋理工大学联合推出的创新框架，用公开资源和高级模型的API接口训练一个高性能的文本到图像生成模型。框架基于与现有高级模型的API交互获取数据对，训练一个基础模型，并借助预训练的大型视...

223

StoryTeller是字节跳动、上海交通大学和北京大学共同推出的系统，能基于音频视觉角色识别技术改善长视频描述的质量和一致性。系统结合低级视觉概念和高级剧情信息，生成详细且连贯的视频描述。StoryTeller由视频分割、...