AI项目

AlphaVow – 一站式 AI 批量图像处理工具

AlphaVow 是专为设计师、摄影师和电商团队推出的一站式 AI 批量图像处理工具。工具整合批量修图、批量文生图、批量发丝级抠图、批量高清修复、批量多人换脸、产品精修及素材管理等七大工具,原生支持高并发批量处理与夜间无人值守挂机。

OpenStory – 开源 AI 视频制作平台,一键生成短剧视频

OpenStory 是开源的 AI 视频制作平台,专注于将剧本一键转化为风格统一的短剧视频。平台能自动拆分场景、设计镜头、分析情绪,调用 Fal.ai 等成熟模型生成图片、视频与音频,同时确保角色外貌、场景布局和视觉风格跨镜头保持一致。

Agnes 2.5 Pro Alpha – Agnes AI 开源的多模态推理模型

Agnes 2.5 Pro Alpha 是 Agnes AI 开源的多模态推理模型,采用 Apache 2.0 协议,权重托管于 Hugging Face。模型支持文本与图像输入,上下文窗口达 1M tokens,擅长复杂代码生成、科学推理、长文档分析与 Agent 工作流。

Newtake – LiblibAI 推出的海外 AI 视频创作平台

Newtake 是 LiblibAI 面向海外推出的 AI 视频创作平台,定位"导演工具",主打影视级内容制作。产品基于无限画布和节点工作流,提供多视角解析、角色一致性管理、电影感灯光、专业镜头复刻等功能,已接入 Seedance 2.5 等模型。

ScienceClaw – 中科紫东太初推出的科研原生智能体平台

ScienceClaw是中科紫东太初(中科院自动化所孵化)推出的科研原生智能体平台,依托紫东太初多模态大模型,覆盖生命科学、材料、化学、物理、天文等领域。

豆包工作 – 字节跳动推出的 AI Agent 办公产品

豆包工作是字节跳动推出的AI Agent办公产品,能自主拆解任务、调用工具,完成写文档、做PPT、搭系统、操作浏览器等复杂工作流。

FireRedTTS3 – 小红书开源的统一语音生成与编辑模型

FireRedTTS3 是小红书 FireRed 团队开源的统一语音生成与编辑模型。模型基于 RedAE 语义增强连续表示与 LLM-DiT 架构,单一模型可实现24 种语言 + 21 种中文方言的零样本音色克隆、自然语言描述的声音设计,以及指定区域的精准语音编辑。

Faraday – Inherent 推出的 AI 科学家智能体

Faraday 是伦敦 AI 实验室 Inherent 推出的 AI 科学家智能体,基于 270 亿参数的 Qwen 3.6 模型,通过强化学习训练而成。Faraday能像人类博士生一样,在不预先知道答案的情况下,自主阅读论文、设计实验并复现研究结果。

PikaPio – AI + AR 创意内容社区与零代码创作平台

PikaPio 是 XOSMO 推出的 AI+AR 创意内容社区与零代码创作平台。平台让普通用户无需编程可创作 AR 内容,覆盖趣味周边、地标体验、创意滤镜等场景。

huashu-excel – 花叔开源的 AI 数据分析 Skill

huashu-excel 是花叔开源的 AI 数据分析 Skill,通过八步流程,包括体检→清洗→对齐→分析→对账→交付→验图→质控,解决 AI 做数据分析时算错不报错的核心问题。

OpenBot – CopilotKit 开源的企业级 AI Agent 平台

OpenBot 是 CopilotKit 开源的企业级 AI Agent 平台,定位是"敢托付真实工作的数字同事"。给每个 Agent 配一台专属"电脑"。独立 Docker 容器内含 Chromium 浏览器、登录会话和文件工作区;所有操作必须经唯一网关按 CEL 策略先审计、后执行,fail-closed 默认拒绝;遇到登录或 2FA 可让人"接管方向盘"完成人工步骤。

HyCreator – 腾讯混元团队推出的 AI 长视频生成平台

HyCreator(影廊)是腾讯混元团队推出的AI长视频生成平台,采用端到端Auto Mode,用户只需输入一句话创意,Agent可自动完成剧本扩展、角色/场景/道具资产生成、视频片段制作及最终合成,可产出10分钟量级长片。

TeleAgent – 中国电信天翼 AI 推出的桌面级通用智能体助手

TeleAgent(星辰超级智能体) 是中国电信天翼 AI 推出的桌面级通用智能体助手,定位为"AI 办公搭子"。用户用自然语言交代任务,工具能自主拆解、跨应用执行并交付结果,覆盖文件整理、Excel 汇总、数据分析、PPT 制作、行业调研等场景。

FreeToken – 开源端侧 MoE 大模型推理系统,支持满血运行

FreeToken 是 UC Berkeley 与 MIT 等机构联合开源的端侧 MoE 大模型推理系统。系统通过全层双缓冲、带宽自适应混合调度、Agent 状态复用及弹性显存热扩缩容等技术,将个人电脑的 CPU、内存、PCIe 与 GPU 统一为弹性计算平台。

CoinVE-200K – 腾讯开源的大规模组合指令视频编辑数据集

CoinVE-200K 是腾讯视频智创团队开源的大规模组合指令视频编辑数据集,包含 20万组 1080p 视频编辑样本对,每样本含 2-5 条原子编辑指令,包括添加、移除、修改、风格化等,覆盖人物、物体、背景等多类目标,最长 201 帧。

LLM-as-a-Verifier – 斯坦福联合英伟达等开源的通用验证框架

LLM-as-a-Verifier 是斯坦福、UC 伯克利与 NVIDIA 研究院联合开源的通用验证框架。框架无需额外训练,通过用 LLM 评分 Token 的完整 logits 分布生成连续细粒度分数,替代传统离散评分。

Cocode – 开源DeepSeek Harness发行版,提供GUI与TUI双入口

Cocode 是 DeepSeek Harness 的开源发行版,提供桌面 GUI 与终端 TUI 双入口。工具将文件、Git、终端、浏览器和 Agent 共处一个工作空间,会话实时同步。Agent 能力通过 preset 插件自由拆解组装,关键操作需确认后执行。

DeepSeek-V4-Flash-Vision-Exp – DeepSeek 推出的多模态视觉理解模型

DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek 推出的实验性多模态视觉理解模型。模型在保持 DeepSeek-V4-Flash 文本能力的基础上新增视觉输入,多模态 Agent 表现接近 Opus-4.8。

Tap8 – AI 原生互动视频平台,支持实时双向交互

Tap8是SigmaZ AI推出的AI原生互动视频平台。平台打破传统视频单向播放模式,让用户观看时可点击画面任意元素、实时提问或一键改编内容。Tap8基于自研DLM模型与视觉引导递归自改进技术,无需预置热点可实时理解画面并生成响应。

SenseNova U1.5 Lite – 商汤科技开源的原生统一多模态大模型

SenseNova U1.5 Lite 是商汤科技开源的轻量级原生统一多模态大模型,专为真实视觉创作流程设计。模型原生支持 3-4k 字符超长指令遵循,具备高质量视觉生成、可靠的图像编辑、精准文字排版、精细视觉控制及原生 4K 输出能力。