AI项目
MoWorld – 魔芯科技推出的全球首个高帧率交互式世界模型
MoWorld 是魔芯科技推出的全球首个高帧率交互式世界模型,基于纯国产华为昇腾 NPU 全栈优化,实现最高 50 FPS 实时推理,成本较 GPU 降低 70%。
Seedream 5.0 Pro – 字节跳动推出的多模态图像创作模型
Seedream 5.0 Pro 是字节跳动 Seed 团队推出的多模态图像创作模型,专为复杂专业场景设计。模型在图文匹配、文字渲染与画面美感上全面升级,核心突破包括复杂信息可视化、交互式精准编辑、真实影像质感还原及原生多语种生成。
GenMail – Genspark 推出的 AI 智能邮箱助手
GenMail 是 Genspark 推出的 AI 智能邮箱助手,通过 AI 自动分拣、智能回复和多账号统一管理,解决职场人邮件过载、多账号混乱、回复拖延等痛点。
Grok 4.5 – SpaceXAI推出的新一代旗舰大语言模型
Grok 4.5是SpaceXAI(原xAI)推出的新一代旗舰大语言模型,基于1.5万亿参数V9基础架构。模型在补充训练阶段深度整合Cursor编程数据,显著强化代码生成与软件工程能力。
GPT-Live – OpenAI 推出的新一代语音模型
GPT-Live 是 OpenAI 推出的新一代语音模型,采用全双工架构实现同时听说,每秒多次决策开口、倾听、插话或调用工具。模型将实时交互与深度任务解耦,复杂问题委托后台 GPT-5.5 处理,前台保持流畅对话。
Robostral Navigate – Mistral AI 推出的具身智能导航模型
Robostral Navigate 是 Mistral AI 推出的首个具身智能导航模型,用一个普通 RGB 摄像头可让机器人在复杂环境中自主导航。模型参数规模为 8B,在 R2R-CE 基准测试的未知环境上达到 76.6% 成功率,超越多传感器方案。
LingBot-Video – 蚂蚁灵波开源面向具身智能的视频模型
LingBot-Video 是蚂蚁灵波科技开源的全球首个面向具身智能的 MoE 视频生成基础模型。模型基于 DiT + MoE 架构,总参数 30B 仅激活约 3B,兼顾大容量与高效推理。
JellyToken – 阿里元境推出的一站式AI大模型聚合平台
JellyToken(智渲云)是阿里元境推出的国内主流 AI 大模型一站式 API 聚合平台,支持一个 API Key 调用通义千问、DeepSeek、豆包、智谱、月之暗面等全品类模型,覆盖文本、图像、视频、音频四大场景。
MkSaaS – 专为快速构建 AI SaaS 产品设计的全栈框架
MkSaaS 是专为快速构建 AI 驱动 SaaS 产品而设计的 Next.js 完整样板代码(Boilerplate),集成了 AI 功能、用户认证、支付系统、国际化、博客、文档、仪表盘、营销页面、SEO 优化等核心模块,帮助开发者在一个周末内就能上线生产级的 SaaS 产品,无需从零搭建基础设施。
YourHair – AI 在线发型设计与测试工具,多维面部分析
YourHair 是基于 AI 的在线发型设计与测试工具,用户只需上传一张正面头像,可生成包含脸型、发质、气质分析在内的专属发型报告,智能推荐 15 款发型效果图(最适合 5 款、普通推荐 5 款、不建议 5 款)。
Claude Science – Anthropic推出的 AI 科研工作台
Claude Science是Anthropic推出的AI科研工作台,定位为科学家的AI工作平台。平台基于Claude Opus 4.8的科研专用环境,将文献检索、数据分析、代码执行、图表生成和论文撰写整合到单一界面。
Yeri AI – AI 全能在线创作平台,覆盖完整内容生产流程
Yeri AI 是 AI 图片生成、AI 视频生成、照片特效与创意编辑于一体的全能型在线创作平台。整合了文生图、图生图、文生视频、图生视频、AI 图片编辑器、背景移除、扩图、图片放大及多种照片特效模板,让用户无需在多个工具之间切换,能在同一个工作区内完成从灵感构思到成品输出的完整内容生产流程。
LongCat-2.0 – 美团开源的新一代万亿参数语言模型
LongCat-2.0 是美团开源的大规模 MoE 语言模型,拥有 1.6 万亿总参数,每 token 激活约 480 亿,基于 AI ASIC 超算集群完成训练与部署。
WorkRally – 腾讯视频推出的工业级AI漫剧制作平台
WorkRally 是腾讯视频推出的首款面向精品漫剧制作的工业级AI平台,面向2D/3D动漫及AI仿真人剧等内容,覆盖从剧本解析、分镜生成、内容生产到资产管理与团队协作的完整生产链路,为创作者提供一体化精品漫剧生产系统。
yuxinlu1 Gemma4-12B – 开源的编程与 Agentic 模型系列
yuxinlu1 Gemma4-12B 是个人开发者逯雨基于 Google Gemma 4 12B 指令模型微调的开源编程与 Agentic 模型系列,包含 V1 代码版和 V2 Agentic 版 。
RedKnot – 小红书开源的长文本推理加速引擎
RedKnot 是小红书开源的长文本 LLM 推理加速引擎,将 KV Cache 按注意力头维度解耦,离线分类为需全局重算的全局头与可局部复用的局部头,配合 SegPagedAttention 实现按头分页存储与融合变长注意力内核,避免 attn_mask 带来的内核惩罚。
虎牙VAM 1.0 – 虎牙推出的实时多模态数字人基础模型
虎牙VAM 1.0(Vivid Avatar Model)是虎牙推出的基于DiT架构的实时多模态数字人基础模型,一张照片可生成能说话、能唱歌跳舞的AI数字人。
T:0 – Airwallex 推出的 AI-native 自主财务平台
T:0 是 Airwallex 推出的 AI-native 自主财务平台,通过 Accountant、Tax Preparer、Integrator、Scout、CFO 五大智能体协作,从企业成立 Day 0 起端到端自动化记账、税务、合规、预测与财报。
Nano Banana 2 Lite – 谷歌推出的轻量级 AI 图像生成模型
Nano Banana 2 Lite 是谷歌推出的自研轻量级 AI 图像生成模型,定位速度优先的极速版,可在 4 秒内生成单张图像,每千张收费仅 0.034 美元。
LocateAnything – 英伟达推出的视觉语言定位模型
LocateAnything是英伟达推出的视觉语言定位模型,基于并行框解码技术,用户输入自然语言即可在图像中精准框选目标。模型支持多目标检测、GUI定位、OCR文本检测和点级指向等任务,推理速度达12.7 BPS(H100)。
粤公网安备 123456789号