RabbitVis – 兔展智能推出的一站式 AI 设计生产工具
RabbitVis 是兔展智能推出的图层级一站式 AI 设计生产工具,基于自研 UniWorld-Design 视觉大模型,将 AI 生成能力与图层编辑能力深度融合。
Muse Code – Meta 推出的终端编程 AI 智能体
Muse Code 是 Meta 推出的终端编程 AI 智能体,基于 Muse Spark 1.2 模型,可处理大型代码库中的完整软件工程任务,包括规划变更、编写代码与验证结果。
Acti – AI 智能键盘,一键触发复杂任务
Acti 是新加坡团队开发的 AI 智能键盘。键盘将 AI 嵌入手机键盘层,用户长按空格键即可触发 Acti Bar,无需跳转应用可查信息、搜文件、建会议或运行工作流。
Hunyuan3D-Buffalo 1.0 – 腾讯混元推出的 3D 多模态框架
Hunyuan3D-Buffalo 1.0 是腾讯混元推出的统一3D多模态框架,通过共享的 Hunyuan3D-VLM 主干将3D问答、空间定位、文生3D、指令编辑和部件生成集成到单一流程中。
Omega – 腾讯推出的 AI 原生数据分析平台
Omega 是腾讯推出的 AI 原生数据分析平台,内测版名为「马尔摩斯(marmos)」。工具通过 Agent 驱动完整分析链路,让用户用自然语言可生成可交互、可迭代、可定时刷新的数据仪表盘,真正将 AI 嵌入业务工作流。
Wan3.0 – 阿里万相最新推出的视频生成大模型
Wan3.0 是阿里云万相团队最新推出的视频生成大模型。模型在生成时长、万能创作、全能参考与真实感等维度全面升级,单次可生成 30秒 视频,首次支持 doc、xls、ppt、pdf、md 等文档格式输入,实现万物皆可生视频。
SayIt – 开源 AI 语音输入法,自动将口语转为书面表达
SayIt 是开源的 AI 语音输入法,基于 Rust 构建,支持 Windows 桌面端。用户按住快捷键说话,可将口语实时转为可直接使用的书面文字。
悟界·RoboBrain Orca – 智源推出的多模态表征世界模型
悟界·RoboBrain Orca 是智源研究院推出的多模态表征世界模型,以下一个状态预测替代传统下一个词/帧/动作预测,让 AI 在内部构建统一的世界潜在表征。
Nemotron-Labs-Diffusion – 英伟达开源的三模式语言模型
Nemotron-Labs-Diffusion 是 NVIDIA 推出的三模式语言模型,在单一架构内统一自回归、扩散和自我推测解码。通过联合 AR-扩散目标训练,模型可在不同并发场景下切换模式维持高吞吐量。
豆包音频生成模型1.0实测 – 多角色配音、有声书一键生成
你可能也在烦恼:用 AI 生成大片,画面质感已经很到位了,可角色一开口,瞬间让人出戏。画面里明明在经历生死关头,配音听起来却像在四平八稳地念产品说明书;好不容易有点情绪起伏,也全靠生硬的大喊大叫...更难受的是,不同的片段里角色的音色完全不一样,很难保持音色一致性。
不用花钱的 AI 换脸方案 – VisoMaster-Fusion 批量视频图片换脸
今天发点适合做视频/图片换脸的东西。平时让想弄点恶搞视频或者图片时,换脸用 PS 老是 P 的不好,用 AI 吧又有点贵。我终于在GitHub上找到一个好东西,叫 VisoMaster-Fusion,本地就能完成视频或者图片的换脸功能,我的 3060 都带的动。
Clawd-on-desk实测 – 能实时反馈 AI Agent 状态的桌面宠物
今天发点适合养桌宠的东西。我们平时用 Claude Code 、Codex CLI做事时,终端里文字一直在滚动,不认真看根本就不知道 Agent 在干嘛。今天给大家推荐一个在 GitHub 上叫 Clawd-on-desk 桌宠项目,Clawd-on-desk 能自动感知 AI Agent 状态,余光一扫就能知道 AI 在思考、跑工具、还是已经完成了。
MoWorld – 魔芯科技推出的全球首个高帧率交互式世界模型
MoWorld 是魔芯科技推出的全球首个高帧率交互式世界模型,基于纯国产华为昇腾 NPU 全栈优化,实现最高 50 FPS 实时推理,成本较 GPU 降低 70%。
Seedream 5.0 Pro – 字节跳动推出的多模态图像创作模型
Seedream 5.0 Pro 是字节跳动 Seed 团队推出的多模态图像创作模型,专为复杂专业场景设计。模型在图文匹配、文字渲染与画面美感上全面升级,核心突破包括复杂信息可视化、交互式精准编辑、真实影像质感还原及原生多语种生成。
GenMail – Genspark 推出的 AI 智能邮箱助手
GenMail 是 Genspark 推出的 AI 智能邮箱助手,通过 AI 自动分拣、智能回复和多账号统一管理,解决职场人邮件过载、多账号混乱、回复拖延等痛点。
Grok 4.5 – SpaceXAI推出的新一代旗舰大语言模型
Grok 4.5是SpaceXAI(原xAI)推出的新一代旗舰大语言模型,基于1.5万亿参数V9基础架构。模型在补充训练阶段深度整合Cursor编程数据,显著强化代码生成与软件工程能力。
GPT-Live – OpenAI 推出的新一代语音模型
GPT-Live 是 OpenAI 推出的新一代语音模型,采用全双工架构实现同时听说,每秒多次决策开口、倾听、插话或调用工具。模型将实时交互与深度任务解耦,复杂问题委托后台 GPT-5.5 处理,前台保持流畅对话。
Robostral Navigate – Mistral AI 推出的具身智能导航模型
Robostral Navigate 是 Mistral AI 推出的首个具身智能导航模型,用一个普通 RGB 摄像头可让机器人在复杂环境中自主导航。模型参数规模为 8B,在 R2R-CE 基准测试的未知环境上达到 76.6% 成功率,超越多传感器方案。
LingBot-Video – 蚂蚁灵波开源面向具身智能的视频模型
LingBot-Video 是蚂蚁灵波科技开源的全球首个面向具身智能的 MoE 视频生成基础模型。模型基于 DiT + MoE 架构,总参数 30B 仅激活约 3B,兼顾大容量与高效推理。
JellyToken – 阿里元境推出的一站式AI大模型聚合平台
JellyToken(智渲云)是阿里元境推出的国内主流 AI 大模型一站式 API 聚合平台,支持一个 API Key 调用通义千问、DeepSeek、豆包、智谱、月之暗面等全品类模型,覆盖文本、图像、视频、音频四大场景。
粤公网安备 123456789号