Qwen3-VL-Embedding – 阿里通义开源的多模态信息检索模型

Qwen3-VL-Embedding 是阿里通义推出的多模态信息检索模型,专为处理文本、图像、可视化文档和视频等多种模态输入而设计。模型基于强大的 Qwen3-VL 架构,能将不同模态的数据映射到统一的语义空间,生成语义丰富的高维向量。

DeepTutor – 香港大学开源的AI学习助手

DeepTutor 是香港大学数据科学实验室开源的 AI 学习助手,通过多智能体架构和知识图谱技术,将复杂的知识体系转化为高效的学习体验。

Qwen3-VL-Reranker – 阿里通义开源的跨模态理解模型

Qwen3-VL-Reranker 是阿里通义基于 Qwen3-VL 构建的跨模态理解模型,专为多模态信息检索设计。模型接收任意模态组合的查询与文档对(如图文查询匹配图文文档),通过单塔架构和交叉注意力机制,深度分析语义关联,输出精确的相关性分数。

Nemotron Speech ASR – 英伟达开源的语音识别模型

Nemotron Speech ASR 是英伟达开源的专注于低延迟、实时流式语音识别的模型。通过缓存感知架构,将已处理的语音特征缓存,仅对新音频帧进行计算,实现单句转录锁定仅需24毫秒,有效解决了传统流式模型在长语音识别中的累积延迟问题。

FantasyWorld – 高德地图联合北邮推出的3D世界建模框架

FantasyWorld是高德地图(AMAP)和北京邮电大学合作开发的创新性3D世界建模框架,专注于通过统一的视频和3D预测生成高质量的3D场景。框架通过在冻结的视频基础模型中增加可训练的几何分支,实现了视频潜变量和隐式3D场的联合建模

Obsidian-skills – Obsidian推出的开源AI工具包

Obsidian-skills 是 Obsidian 团队开发的一组开源工具,帮助用户更好地将 AI 工具(如 Claude Code)与 Obsidian 笔记系统结合使用。包含三大核心技能:obsidian-markdown、obsidian-bases 和 json-canvas。

女娲智能体OS – 首个产品级开源的通用智能体操作系统

女娲智能体OS(Nuwax Agent OS)是全球首个产品级开源的通用智能体操作系统。女娲智能体OS支持将AI从单纯的对话工具转变为企业的智能执行者,通过自主执行引擎实现从需求拆解到任务执行的全链路自动化。

Spirit-v1.5 – 千寻智能推出的具身智能基础模型

Spirit-v1.5 是千寻智能推出的具身智能基础模型。模型采用多样化、开放式的数据采集方式,摒弃传统“干净数据”的限制,让模型在预训练阶段接触更丰富的动作和场景,具备更强的泛化能力和适应性。

Oh My OpenCode – AI编程助手增强插件,自动调度任务

Oh My OpenCode 是为 AI 编程助手设计的开源增强插件,能让 AI (如OpenCode )像真正的开发团队一样高效协作,提升编程体验。工具通过集成多种 AI 模型(如 OpenAI、Gemini、Claude 等),为开发者提供强大的编程助手。

Claude Code之父Boris Cherny分享13个高效使用技巧

Claude Code之父Boris Cherny分享Claude Code的工作流和使用技巧,如何并行运行多个Claude实例、多平台协同工作、使用Opus 4.5模型、团队共享文件、计划模式启动会话、创建斜杠命令、利用子代理、格式化代码、预设权限、处理长时间任务等13个核心技巧。

实测百度文库AI PPT制作,一键排版美化生成专业PPT

最近千问 PPT 刷屏了。又是免费,又是各种模板,看起来很香。我也第一时间去试了,结论先说:差点意思。免费是香,但基本只有 20% 能用;模板有,但重复度太高;还经常给我莫名其妙的配图。都 2026 年了,你会发现一个残酷的事实:真正靠谱的 AI PPT 工具,仍然非常稀缺。直到我用回了 PPT 赛道的“老玩家”——百度文库。简单对比这两个工具,你就知道文库悄悄把 AI PPT 这事,卷到了什么程

吴恩达推出免费的AI编程入门课程《Build with Andrew》

《Build with Andrew》是 AI 领域知名专家吴恩达Andrew Ng主讲的入门级课程,专为零基础学习者设计。课程时长约30分钟,采用在线自学形式,通过视频讲解、AI互动练习和项目实践,帮助学员快速掌握如何用AI工具构建和定制应用程序,无需编码经验。

怎么用云幕同声AI视频翻译工具,制作优质跨境视频

在当今全球化的时代,信息的跨国交流日益频繁,语言障碍成为人们获取知识、进行商务合作以及文化交流的重要阻碍。随着人工智能技术的飞速发展,AI视频翻译工具应运而生,为打破这一壁垒提供了强大的助力。云幕同声作为一款领先的AI视频翻译工具,正在重新定义视频内容的无障碍传播。

智源发布《2026十大AI技术趋势》(PDF文件)

智源研究院发布的《2026十大AI技术趋势》,聚焦于人工智能从数字空间迈向物理世界的变革。报告指出,AI发展正从参数规模竞赛转向对物理世界底层秩序的理解与建模,核心趋势包括世界模型与Next-State Prediction(NSP)新范式的兴起。

Tencent-HY-MT1.5 – 腾讯混元开源的翻译模型

Tencent-HY-MT1.5 是腾讯混元开源的翻译模型,包含两个版本Tencent-HY-MT1.5-1.8B 和 Tencent-HY-MT1.5-7B。模型支持33种国际语言互译及5种民汉/方言翻译,覆盖多种小语种。

PersonaLive – 澳门大学等开源的实时AI换脸直播工具

PersonaLive 是澳门大学和 GVC 实验室开源的实时数字人直播工具。工具能在单张 12GB 显存的消费级显卡上运行,实现无限时长的肖像动画生成,支持低延迟互动。

Yume1.5 – 上海AI Lab联合复旦开源的交互式世界生成模型

Yume1.5 是上海人工智能实验室和复旦大学等推出的交互式世界生成模型,能从单张图像或文本提示生成逼真、连续且可探索的虚拟世界。

Computer Use Preview – 谷歌开源的AI浏览器自动化工具

Computer Use Preview 是谷歌开源的 AI 浏览器自动化工具。工具基于 Gemini 模型的视觉识别能力,通过“截图 - 分析 - 行动”能模拟人类操作网页,无需依赖固定的元素定位。

Step-DeepResearch – 阶跃星辰推出的深度研究AI模型

Step-DeepResearch是阶跃星辰推出的32亿参数深度研究AI模型,能在单次推理中完成复杂研究任务并生成专业报告。模型采用单体架构设计,通过规划、深度搜索、反思验证和报告撰写四大核心能力,实现了高效低成本的研究闭环。

Manus项目立项核心讨论纪要(PDF文件)

Manus 项目立项初期会议纪要详细记录了团队关于产品定位、技术架构、用户体验和人机协作模式的深度讨论。核心议题包括选择通用智能体还是垂直领域专家的战略抉择,构建具备“代理”能力的云端环境,设计兼顾信任与控制的用户界面。