标签:多模态AI
包含标签「多模态AI」的全部资源
共 14 个结果
多模态AI代理栈
TARS是一个多模态AI代理栈,包含Agent TARS和UI-TARS-desktop两个项目,提供终端、计算机和浏览器的GUI代理和视觉功能,适用于自动化任务和智能控制。
多模态AI数据基础设施服务
Pixeltable MCP Server (Developer Edition) 是一个多模态AI数据基础设施服务,提供目录管理、AI/ML管道、依赖管理、项目脚手架和交互式REPL等功能,适用于开发者进行AI和机器学习项目开发。
多模态AI生成服务器
Gemini MCP Server是一个基于Google Gemini AI服务的模型上下文协议服务器,提供包括图像生成、图像编辑和视频创建在内的先进多模态生成能力。
多模态视觉分析服务器
UI Vision MCP Server是一个支持多模型视觉分析的工具,允许用户通过外部视觉AI模型(如GLM、Gemini、GPT-4o等)进行图像分析。
视觉桥接服务
MCP Vision Bridge是一个模型上下文协议服务器,使非视觉LLM能够通过OpenRouter利用视觉模型的能力。
多模态AI聊天机器人
一款基于Next.js和React构建的高级AI聊天机器人,支持多模态对话、内容生成、网络搜索和可扩展工具集成,适用于开发者和内容创作者。
多模态AI聊天机器人
一款基于Jac语言和MCP协议的多模态AI聊天机器人,支持文档、图像和视频的交互与智能搜索。
多模态AI聊天客户端
一个集成MCP(模型上下文协议)工具的多模态AI聊天客户端,支持文本和图像交互,提供丰富的配置选项和多种图像输入方式。
多模态AI集成平台
Osoba是一个集成了本地和托管LLM、智能网络搜索、内容提取、SQL查询、YouTube转录分析、HubSpot操作、Python数据分析、Canva设计创建、Figma设计检查、Poe多模态AI(文本、图像、视频、音频生成)以及Codex MCP服务器(用于安全代码脚手架)的多功能AI平台。
多模型生成服务
Atlas Cloud MCP Server 提供300+图像、视频、语言模型的统一API调用,支持跨平台集成开发工具链,适用于内容生成、媒体编辑及AI助手开发场景。
宠物食品智能助手
一个基于OpenAI ChatKit的多模态AI代理,提供文本聊天、语音助手和图像分析功能,帮助用户为宠物选择合适食品。
AI VTuber控制系统
一个基于多模态AI的VTuber控制系统,支持语音、视觉、听觉输入,与Unreal Engine集成,适用于虚拟主播和交互式AI场景。
多模态AI聊天机器人
构建一个能够与文档、图像和视频交互的多模态AI聊天机器人,支持文件上传、上下文感知回答、网络搜索及AI视觉理解。
多模态AI代理
Kubrick AI是一个开源的多模态AI代理,能够处理图像、文本、音频和视频,适用于视频搜索、语义理解和实时交互等场景。
