悟界·RoboBrain Orca – 智源推出的多模态表征世界模型
悟界·RoboBrain Orca 是智源研究院推出的多模态表征世界模型,以下一个状态预测替代传统下一个词/帧/动作预测,让 AI 在内部构建统一的世界潜在表征。
Nemotron-Labs-Diffusion – 英伟达开源的三模式语言模型
Nemotron-Labs-Diffusion 是 NVIDIA 推出的三模式语言模型,在单一架构内统一自回归、扩散和自我推测解码。通过联合 AR-扩散目标训练,模型可在不同并发场景下切换模式维持高吞吐量。
豆包音频生成模型1.0实测 – 多角色配音、有声书一键生成
你可能也在烦恼:用 AI 生成大片,画面质感已经很到位了,可角色一开口,瞬间让人出戏。画面里明明在经历生死关头,配音听起来却像在四平八稳地念产品说明书;好不容易有点情绪起伏,也全靠生硬的大喊大叫...更难受的是,不同的片段里角色的音色完全不一样,很难保持音色一致性。
不用花钱的 AI 换脸方案 – VisoMaster-Fusion 批量视频图片换脸
今天发点适合做视频/图片换脸的东西。平时让想弄点恶搞视频或者图片时,换脸用 PS 老是 P 的不好,用 AI 吧又有点贵。我终于在GitHub上找到一个好东西,叫 VisoMaster-Fusion,本地就能完成视频或者图片的换脸功能,我的 3060 都带的动。
Clawd-on-desk实测 – 能实时反馈 AI Agent 状态的桌面宠物
今天发点适合养桌宠的东西。我们平时用 Claude Code 、Codex CLI做事时,终端里文字一直在滚动,不认真看根本就不知道 Agent 在干嘛。今天给大家推荐一个在 GitHub 上叫 Clawd-on-desk 桌宠项目,Clawd-on-desk 能自动感知 AI Agent 状态,余光一扫就能知道 AI 在思考、跑工具、还是已经完成了。
MoWorld – 魔芯科技推出的全球首个高帧率交互式世界模型
MoWorld 是魔芯科技推出的全球首个高帧率交互式世界模型,基于纯国产华为昇腾 NPU 全栈优化,实现最高 50 FPS 实时推理,成本较 GPU 降低 70%。
Seedream 5.0 Pro – 字节跳动推出的多模态图像创作模型
Seedream 5.0 Pro 是字节跳动 Seed 团队推出的多模态图像创作模型,专为复杂专业场景设计。模型在图文匹配、文字渲染与画面美感上全面升级,核心突破包括复杂信息可视化、交互式精准编辑、真实影像质感还原及原生多语种生成。
GenMail – Genspark 推出的 AI 智能邮箱助手
GenMail 是 Genspark 推出的 AI 智能邮箱助手,通过 AI 自动分拣、智能回复和多账号统一管理,解决职场人邮件过载、多账号混乱、回复拖延等痛点。
Grok 4.5 – SpaceXAI推出的新一代旗舰大语言模型
Grok 4.5是SpaceXAI(原xAI)推出的新一代旗舰大语言模型,基于1.5万亿参数V9基础架构。模型在补充训练阶段深度整合Cursor编程数据,显著强化代码生成与软件工程能力。
GPT-Live – OpenAI 推出的新一代语音模型
GPT-Live 是 OpenAI 推出的新一代语音模型,采用全双工架构实现同时听说,每秒多次决策开口、倾听、插话或调用工具。模型将实时交互与深度任务解耦,复杂问题委托后台 GPT-5.5 处理,前台保持流畅对话。
Robostral Navigate – Mistral AI 推出的具身智能导航模型
Robostral Navigate 是 Mistral AI 推出的首个具身智能导航模型,用一个普通 RGB 摄像头可让机器人在复杂环境中自主导航。模型参数规模为 8B,在 R2R-CE 基准测试的未知环境上达到 76.6% 成功率,超越多传感器方案。
LingBot-Video – 蚂蚁灵波开源面向具身智能的视频模型
LingBot-Video 是蚂蚁灵波科技开源的全球首个面向具身智能的 MoE 视频生成基础模型。模型基于 DiT + MoE 架构,总参数 30B 仅激活约 3B,兼顾大容量与高效推理。
JellyToken – 阿里元境推出的一站式AI大模型聚合平台
JellyToken(智渲云)是阿里元境推出的国内主流 AI 大模型一站式 API 聚合平台,支持一个 API Key 调用通义千问、DeepSeek、豆包、智谱、月之暗面等全品类模型,覆盖文本、图像、视频、音频四大场景。
MkSaaS – 专为快速构建 AI SaaS 产品设计的全栈框架
MkSaaS 是专为快速构建 AI 驱动 SaaS 产品而设计的 Next.js 完整样板代码(Boilerplate),集成了 AI 功能、用户认证、支付系统、国际化、博客、文档、仪表盘、营销页面、SEO 优化等核心模块,帮助开发者在一个周末内就能上线生产级的 SaaS 产品,无需从零搭建基础设施。
YourHair – AI 在线发型设计与测试工具,多维面部分析
YourHair 是基于 AI 的在线发型设计与测试工具,用户只需上传一张正面头像,可生成包含脸型、发质、气质分析在内的专属发型报告,智能推荐 15 款发型效果图(最适合 5 款、普通推荐 5 款、不建议 5 款)。
实测 Awesome-design-md – 精准复刻知名产品网页风格
今天发点适合做网页设计的东西。平时我们让 Cursor、Claude Code、Codex、这些Agent 做页面,经常会遇到一个问题:跟 AI 说了想要复刻什么风格的页面,但是复刻出来总是只有一点点相似,根本不符合我们的预想。今天就给大家推荐一个GitHub上的项目叫:Awesome-design-md,专门用来复刻知名产品的网页风格。
Claude Science – Anthropic推出的 AI 科研工作台
Claude Science是Anthropic推出的AI科研工作台,定位为科学家的AI工作平台。平台基于Claude Opus 4.8的科研专用环境,将文献检索、数据分析、代码执行、图表生成和论文撰写整合到单一界面。
Yeri AI – AI 全能在线创作平台,覆盖完整内容生产流程
Yeri AI 是 AI 图片生成、AI 视频生成、照片特效与创意编辑于一体的全能型在线创作平台。整合了文生图、图生图、文生视频、图生视频、AI 图片编辑器、背景移除、扩图、图片放大及多种照片特效模板,让用户无需在多个工具之间切换,能在同一个工作区内完成从灵感构思到成品输出的完整内容生产流程。
Wan-Streamer – 阿里开源的实时全双工多模态基础模型
Wan-Streamer 是阿里达摩院开源的端到端实时全双工多模态基础模型,通过统一因果 Transformer 架构将文本、音频、视频的输入输出 token 整合为同一条因果序列,实现亚秒级实时双向视频交互,模型响应延迟仅 200ms。
LongCat-2.0 – 美团开源的新一代万亿参数语言模型
LongCat-2.0 是美团开源的大规模 MoE 语言模型,拥有 1.6 万亿总参数,每 token 激活约 480 亿,基于 AI ASIC 超算集群完成训练与部署。
粤公网安备 123456789号