AI项目

Orbis – Visko推出的实时世界模型,让AI视频像直播一样

Orbis 是 Visko 推出的首个 Live Model(实时世界模型),让 AI 视频像直播一样持续运转。用户可随时输入新指令实时改变画面走向,无需等待成片。模型支持 4K@24FPS 实时流式生成,通过多尺度记忆机制维持小时级长时一致性。

SchoAI思果学术 – 科研学术 AI 助手,一键完成论文写作

SchoAI思果学术是专为教授、老师及本硕博生推出的科研学术AI助手。工具基于用户本地知识库,内置100+科研Skills,支持论文写作、课件生成、项目书撰写、科研绘图及文献深度分析。

Pi – 开源的终端编程 Agent,支持自定义工具与模型接入

Pi (Agent Harness) 是极简开源的终端编程 Agent,由 Mario Zechner 推出,同时是 OpenClaw 的底层 Coding Agent。工具只给模型 read、write、edit、bash 四个基础工具,系统提示词不到 1000 token,其余功能全部交给 TypeScript 扩展。

MAI-Transcribe-2 – 微软推出的最强 AI 语音转文字模型

MAI-Transcribe-2 是微软推出的最强AI语音转文字模型,在准确率、速度和成本上全面领先。模型支持60种语言,FLEURS测试集平均词错误率仅5.2%。

zg – Zvec AI 开源的本地优先统一检索基础工具

zg(zvec-grep) 是 Zvec AI 开源的本地优先统一检索基础工具,面向开发者与 AI Agent。工具将 ripgrep 精确匹配、BM25 词法检索与向量语义检索融为一体,解决自然语言意图与代码/文档实际表述之间的词汇鸿沟,实现从模糊探索到精确定位的完整检索链路。

E-Commerce Bench – 千问联合淘天开源电商经营评测基准

E-Commerce Bench 是阿里通义千问联合淘天集团开源的长程电商经营评测基准。E-Commerce Bench让 LLM Agent 以 10 万元本金在模拟真实市场中经营网店 365 天,涵盖选品、供应商谈判、定价、库存与现金流管理。

GPT-6 Astra – OpenAI 推出的最新旗舰大模型

GPT-6 Astra 是 OpenAI 推出的旗舰大模型,官方称其为「全球最智能、最符合人类意图的模型」。模型突破传统聊天边界,进化为能独立操作软件、浏览网页、完成复杂任务的 AI Agent。

Cheso – 腾讯推出的 AI PPT Agent 制作工具

Cheso 是腾讯推出的 AI 原生演示文稿 Agent。工具能自主完成调研,用户只需用自然语言描述需求,Cheso 会自动联网检索信息、交叉验证来源、规划内容结构,最终生成一份设计精美且信息准确的演示文稿。

Muse Spark 1.3 – Meta 推出的新一代大语言模型

Muse Spark 1.3 是 Meta 推出的新一代大语言模型,由扎克伯格亲自站台,定位为 Meta 在编程和智能体任务上的重大突破。

Easel – 浙大联合北大开源的 AI 社交媒体内容工作台

Easel 是浙江大学与北京大学联合开源的 AI 社交媒体内容工作台。平台基于 OpenClaw Agent 框架,用一个智能体打通社媒运营全链路,从热点发现、选题策划、内容创作到多平台发布与数据复盘。

Gemini 3.8 – 谷歌推出的推理与编码模型

Gemini 3.8 是 Google 推出的推理与编码模型,包含 Flash 和 Flash Cyber 两个版本。Gemini 3.8 Flash 在保持与前代相同速度和低价的基础上,大幅提升软件工程、Agent 任务及多步推理能力,在代码、金融、法律等基准测试中接近甚至超越更大参数的前沿模型。

Fusion Model – FUMO Lab 推出的智能分配模型

Fusion Model 是 FUMO Lab 推出的智能分配模型。模型能根据不断演化的任务状态,动态将计算需求分配给最适合的异构模型,实现"一次融合,尽揽众长"。

Hy4 preview 轻量版 – 腾讯混元开源的Hy4量化压缩模型

Hy4 preview 轻量版是腾讯混元将原本 1.5TB 的 Hy4 preview 开源大模型,通过自研 Sherry 1.25bit 稀疏量化与 MIX-STQ1_0 逐层混合精度技术,压缩至约 214GB 的版本。

Claude Fable 5.1 – Anthropic 推出的最新旗舰大模型

Claude Fable 5.1 是 Anthropic 推出的旗舰大模型,定位为目前公开可用的最强 AI 之一。模型专为复杂推理、长周期 Agent 任务和知识工作设计,在科学研究、编码、计算机操作等 8 项基准测试中全面领先上一代,且低推理档位即可达到前代高档位性能。

Atlas – World Labs 推出的全球首个多模态世界模型

Atlas 是李飞飞创办的 World Labs 推出的全球首个多模态世界模型。模型能原生理解文本、图像、视频与 3D 空间信息,通过空间上下文将画面锚定在三维坐标中,实现像素级精确的相机控制生成、稀疏照片 3D 重建及时空模拟。

Claude Mythos 5.1 – Anthropic 推出的 Claude 系列旗舰模型

Claude Mythos 5.1 是 Anthropic 推出的 Claude 5.1 系列旗舰模型,与Claude Fable 5.1 共享同一基础能力。模型专为高风险专业领域设计,仅面向通过审核的网络安全机构和生命科学研究人员开放,支持漏洞防御、蛋白质设计等前沿研究。

Muse Voice Transcribe – Meta 推出的首个实时音频感知模型

Muse Voice Transcribe 是 Meta 推出的首个实时音频感知模型,集流式自动语音识别、说话人分割与端点检测于一体。模型支持 70 多种语言及原生语码切换,可处理超 1 小时长音频与 20 人以上同时对话,在流式转写和语音分割基准测试中均排名第一。

WeMM-Embedding – 腾讯开源通用多模态Embedding模型

WeMM-Embedding 是腾讯微信视觉团队开源的通用多模态 Embedding 模型家族,提供 2B/4B/9B 三种规格。模型将文本、图像、视频、视觉文档及交错多模态输入统一编码到共享向量空间,在 MMEB-v2 基准排行榜位列第一。

MiniMax H3 Max – MiniMax 推出的实时视频生成模型

MiniMax H3 Max 是 MiniMax 推出的实时视频生成模型,基于开源 H3 进行后训练与推理优化。模型支持文生/图生视频并同步生成音频,5 秒 768p 视频不到 3 秒可生成,吞吐量达原生 H3 的 35 倍,在 Artificial Analysis 和 Design Arena 图生视频榜均排名第一。

Ling-3.0-flash-Fin – 蚂蚁百灵推出的首个金融增强模型

Ling-3.0-flash-Fin是蚂蚁百灵推出的首个金融增强模型,基于Ling-3.0-flash架构(124B总参数/5.1B激活参数),面向真实金融工作流。