AI框架
FireRedAudio – 小红书 FireRed 推出的通用音频语言模型
FireRedAudio 是小红书 FireRed 团队推出的通用音频语言模型,基于 9B 参数 Qwen3.5 自回归 LLM。模型理解与生成分别使用独立的连续表征通道(Audio Encoder 与 RedAE),再汇入共享 LLM 统一推理。
Hy-MT2-1.8B – 腾讯混元推出的端侧翻译大模型
Hy-MT2-1.8B 是腾讯混元推出的端侧翻译大模型,仅 1.8B 参数却支持 33 个语种互译,翻译质量在 FLORES-200 等基准上超越微软、豆包等商业 API。
Gemini 3.5 Transcribe – 谷歌推出的最新语音转文本模型
Gemini 3.5 Transcribe 是 Google 推出的最新语音转文本模型,支持实时流式和预录音频处理两种模式,前者通过 Live API 实现亚秒级延迟,后者支持说话人归属与词级时间戳。
QuickDesk – 开源 AI 原生远程桌面,首款内置 MCP Server
QuickDesk 是全球首款内置 MCP Server 的开源 AI 原生远程桌面,基于 Google Chromium Remoting 构建。工具让 Claude、Cursor 等 AI Agent 直接接管任意远程电脑,完成截图、点击、输入、OCR 识别、Shell 执行等自动化操作。
Breeze TTS 2 – BreezeBlue 推出的新一代语音合成模型
Breeze TTS 2 是 BreezeBlue 推出的新一代语音合成模型,支持通过自然语言零样本设计角色音色,用自然语言指令精准控制情绪、语速、口音等表演细节。
TabTin – 开源的全栈 AI Agent 团队协作平台
TabTin 是全栈开源的 AI Agent 团队协作平台。平台让 Agent 真正融入团队工作流,任务可在桌面端发起、手机查看、服务器 Agent 执行,并能带完整上下文交接给同事。
DeepSeek Harness Desktop – 开源的 DeepSeek Harness 桌面端
DeepSeek Harness Desktop 是基于 DeepSeek Harness 的社区开源桌面客户端,支持 Windows 和 macOS。工具将 Harness 的 Web UI、本地服务和插件系统封装为原生应用,开箱即用,无需安装 Node.js。
HiDream-O1-World – 智象未来推出的全模态交互式世界模型
HiDream-O1-World 是智象未来(HiDream.ai)推出的原生全模态交互式世界模型,基于自研 UiT 架构打造。
PixelRAG – 伯克利开源的视觉原生 RAG 框架
PixelRAG 是伯克利 SkyLab/BAIR 开源的视觉原生 RAG 框架。框架跳出网页抽成纯文本再检索的传统路线,改用浏览器把网页、PDF 渲染成截图瓦片,通过 LoRA 微调的 Qwen3-VL 视觉向量检索,让模型直接读图上的表格、图表和版式,解决传统 RAG 丢表格、丢版式的痛点。
Grok Bot – SpaceXAI 推出的 AI Agent 系统,多 Bot 并行协作
Grok Bot 是 SpaceXAI 推出的 AI Agent 系统,能登录用户的账号像真人一样操作网站和工具,24 小时在云端替用户完成实际工作。系统支持多 Bot 并行协作、录制工作流自动执行,甚至 Bot 可创建新 Bot 组建团队。
Qwen-CUA – 阿里 Qwen 等推出的原生 Computer Use Agent
Qwen-CUA 是 Qwen 团队与 XLang Lab 联合推出的原生 Computer Use Agent,基于 397B-A17B 混合专家架构,仅通过截图感知界面状态,无需依赖 DOM 树或辅助功能元数据,直接用键盘和鼠标事件操控浏览器、桌面应用及专业软件。
Hy ASR 3.0 preview – 腾讯混元推出的新一代语音识别模型
Hy ASR 3.0 preview是腾讯混元推出的新一代语音识别模型,基于 Hy3 大语言模型,融合高精度语音识别与深度语义理解。模型支持中文、英语、粤语及10大方言片区,具备上下文智能纠错、热词注入及高噪/耳语等复杂场景鲁棒性。
JoyAI-Video-Edit – 京东开源的实时流式视频编辑模型
JoyAI-Video-Edit是京东开源自研的实时流式视频编辑模型,基于16B参数自回归扩散架构,在720P分辨率下实现30FPS推理速度,支持任意时长稳定流式编辑。
SeedRealtime – 字节跳动推出的原生音视频全双工大模型
SeedRealtime是字节跳动Seed团队推出的原生音视频全双工大模型,基于统一架构原生融合音频、视频与文本,实现边看、边听、边说的全模态实时交互。
MAGI-2-preview – Sand.ai 开源的多模态视频生成模型
MAGI-2-preview 是 Sand.ai 开源的全球首个千亿参数 MoE 多模态视频生成模型,总参数 114B、激活仅 6B。模型延续单流架构,将文本、视频、音频统一纳入同一 Transformer 联合建模,实现原生多模态生成,在 AA 视频生成榜单排名第六。
SayIt – 开源 AI 语音输入法,自动将口语转为书面表达
SayIt 是开源的 AI 语音输入法,基于 Rust 构建,支持 Windows 桌面端。用户按住快捷键说话,可将口语实时转为可直接使用的书面文字。
悟界·RoboBrain Orca – 智源推出的多模态表征世界模型
悟界·RoboBrain Orca 是智源研究院推出的多模态表征世界模型,以下一个状态预测替代传统下一个词/帧/动作预测,让 AI 在内部构建统一的世界潜在表征。
Nemotron-Labs-Diffusion – 英伟达开源的三模式语言模型
Nemotron-Labs-Diffusion 是 NVIDIA 推出的三模式语言模型,在单一架构内统一自回归、扩散和自我推测解码。通过联合 AR-扩散目标训练,模型可在不同并发场景下切换模式维持高吞吐量。
Wan-Streamer – 阿里开源的实时全双工多模态基础模型
Wan-Streamer 是阿里达摩院开源的端到端实时全双工多模态基础模型,通过统一因果 Transformer 架构将文本、音频、视频的输入输出 token 整合为同一条因果序列,实现亚秒级实时双向视频交互,模型响应延迟仅 200ms。
Ornith-1.0 – DeepReinforce 开源的 Agentic 编程系列模型
Ornith-1.0 是 DeepReinforce 团队推出的专为 Agentic 编程任务设计的开源大模型系列,模型基于 Gemma 4 与 Qwen 3.5 预训练基座,采用自改进训练框架,在代码生成与软件工程基准上达到同级别开源模型的 SOTA 水平。
粤公网安备 123456789号