AI项目

GLM-5.3 – 智谱推出的最新 AI 大模型

GLM-5.3 是智谱推出的最新大模型,与 GLM-5.2 基座相同,通过极致的后训练 Scaling 大幅提升智能上界。模型是当前编程能力最强的开源模型,在 Terminal Bench、DeepSWE 等多项基准测试中排名第一;同时涌现出强大的网络安全能力,在白盒代码审查与漏洞发现方面持平 Mythos 5。

dots3-note preview – 小红书开源的多模态 MoE 模型

dots3-note preview 是小红书 dots 模型实验室开源的 dots3 系列首个版本,是 IMO 2026 满分模型同系列。模型采用 280B 总参数/16B 激活参数的 MoE 架构,支持 512K 超长上下文与文本、视觉、语音多模态理解。

MiniMax Music 3.0 – MiniMax 开源的音乐生成模型

MiniMax Music 3.0 是 MiniMax推出的下一代开放权重音乐生成模型。模型采用 8B Global LLM与 0.6B Local LLM 的分层架构,结合 Flow Matching + Flow-VAE 连续隐状态合成技术,可根据歌词和结构化音乐描述生成最长 5 分钟、32kHz 立体声的完整歌曲。

Ling-3.0-tiny – 蚂蚁百灵推出的原生混合推理模型

Ling-3.0-tiny是蚂蚁百灵推出的原生混合推理模型,总参数 7.9B、每 token 仅激活 1.3B,面向数学推理、指令遵循及资源敏感型部署优化。

SALMONN-2 – 清华等开源的通用音频大语言模型

SALMONN-2 是清华大学、上海人工智能实验室与剑桥大学联合开源的通用音频大语言模型,基于字节跳动 SPEAR 统一自监督音频编码器与多层特征融合适配器构建,以 Qwen3 为文本基座,用约 1.8 万小时监督数据便在 MMAU-Pro、MMAR、MMSU 三大综合基准上取得同规模开源模型最佳表现。

Shieldstral – Mistral AI 开源的多模态内容安全分类模型

Shieldstral 是 Mistral AI 推出的 3B 参数开源多模态内容安全分类模型,基于 Ministral-3B 构建。模型将传统固定类别的内容审核重新定义为二元问答任务,支持通过自然语言查询实时定义审核策略,无需重新训练即可适配不同场景。

Get3W – AI 模型聚合平台,统一接口自由切换模型

Get3W 是面向开发者和企业的 AI 模型聚合平台,通过统一 API 一站接入来自 Google、OpenAI、ByteDance、Alibaba、Kling、Midjourney、Runway、MiniMax、Black Forest Labs 等 20 多家厂商的 700+ 模型,能力覆盖视频、图像、音频、3D、全景与对话生成。

InstructAV2AV – 智源联合北大开源的音视频联合编辑模型

InstructAV2AV 是北京智源人工智能研究院与北京大学联合推出的音视频联合编辑模型。用户只需一句自然语言指令,可在端到端生成过程中同时编辑视频画面与对应声音,无需手工掩码或分步处理。

RabbitVis – 兔展智能推出的一站式 AI 设计生产工具

RabbitVis 是兔展智能推出的图层级一站式 AI 设计生产工具,基于自研 UniWorld-Design 视觉大模型,将 AI 生成能力与图层编辑能力深度融合。

Muse Code – Meta 推出的终端编程 AI 智能体

Muse Code 是 Meta 推出的终端编程 AI 智能体,基于 Muse Spark 1.2 模型,可处理大型代码库中的完整软件工程任务,包括规划变更、编写代码与验证结果。

Acti – AI 智能键盘,一键触发复杂任务

Acti 是新加坡团队开发的 AI 智能键盘。键盘将 AI 嵌入手机键盘层,用户长按空格键即可触发 Acti Bar,无需跳转应用可查信息、搜文件、建会议或运行工作流。

Hunyuan3D-Buffalo 1.0 – 腾讯混元推出的 3D 多模态框架

Hunyuan3D-Buffalo 1.0 是腾讯混元推出的统一3D多模态框架,通过共享的 Hunyuan3D-VLM 主干将3D问答、空间定位、文生3D、指令编辑和部件生成集成到单一流程中。

Omega – 腾讯推出的 AI 原生数据分析平台

Omega 是腾讯推出的 AI 原生数据分析平台,内测版名为「马尔摩斯(marmos)」。工具通过 Agent 驱动完整分析链路,让用户用自然语言可生成可交互、可迭代、可定时刷新的数据仪表盘,真正将 AI 嵌入业务工作流。

Wan3.0 – 阿里万相最新推出的视频生成大模型

Wan3.0 是阿里云万相团队最新推出的视频生成大模型。模型在生成时长、万能创作、全能参考与真实感等维度全面升级,单次可生成 30秒 视频,首次支持 doc、xls、ppt、pdf、md 等文档格式输入,实现万物皆可生视频。

MoWorld – 魔芯科技推出的全球首个高帧率交互式世界模型

MoWorld 是魔芯科技推出的全球首个高帧率交互式世界模型,基于纯国产华为昇腾 NPU 全栈优化,实现最高 50 FPS 实时推理,成本较 GPU 降低 70%。

Seedream 5.0 Pro – 字节跳动推出的多模态图像创作模型

Seedream 5.0 Pro 是字节跳动 Seed 团队推出的多模态图像创作模型,专为复杂专业场景设计。模型在图文匹配、文字渲染与画面美感上全面升级,核心突破包括复杂信息可视化、交互式精准编辑、真实影像质感还原及原生多语种生成。

GenMail – Genspark 推出的 AI 智能邮箱助手

GenMail 是 Genspark 推出的 AI 智能邮箱助手,通过 AI 自动分拣、智能回复和多账号统一管理,解决职场人邮件过载、多账号混乱、回复拖延等痛点。

Grok 4.5 – SpaceXAI推出的新一代旗舰大语言模型

Grok 4.5是SpaceXAI(原xAI)推出的新一代旗舰大语言模型,基于1.5万亿参数V9基础架构。模型在补充训练阶段深度整合Cursor编程数据,显著强化代码生成与软件工程能力。

GPT-Live – OpenAI 推出的新一代语音模型

GPT-Live 是 OpenAI 推出的新一代语音模型,采用全双工架构实现同时听说,每秒多次决策开口、倾听、插话或调用工具。模型将实时交互与深度任务解耦,复杂问题委托后台 GPT-5.5 处理,前台保持流畅对话。

Robostral Navigate – Mistral AI 推出的具身智能导航模型

Robostral Navigate 是 Mistral AI 推出的首个具身智能导航模型,用一个普通 RGB 摄像头可让机器人在复杂环境中自主导航。模型参数规模为 8B,在 R2R-CE 基准测试的未知环境上达到 76.6% 成功率,超越多传感器方案。