WorkRally – 腾讯视频推出的工业级AI漫剧制作平台
WorkRally 是腾讯视频推出的首款面向精品漫剧制作的工业级AI平台,面向2D/3D动漫及AI仿真人剧等内容,覆盖从剧本解析、分镜生成、内容生产到资产管理与团队协作的完整生产链路,为创作者提供一体化精品漫剧生产系统。
yuxinlu1 Gemma4-12B – 开源的编程与 Agentic 模型系列
yuxinlu1 Gemma4-12B 是个人开发者逯雨基于 Google Gemma 4 12B 指令模型微调的开源编程与 Agentic 模型系列,包含 V1 代码版和 V2 Agentic 版 。
RedKnot – 小红书开源的长文本推理加速引擎
RedKnot 是小红书开源的长文本 LLM 推理加速引擎,将 KV Cache 按注意力头维度解耦,离线分类为需全局重算的全局头与可局部复用的局部头,配合 SegPagedAttention 实现按头分页存储与融合变长注意力内核,避免 attn_mask 带来的内核惩罚。
虎牙VAM 1.0 – 虎牙推出的实时多模态数字人基础模型
虎牙VAM 1.0(Vivid Avatar Model)是虎牙推出的基于DiT架构的实时多模态数字人基础模型,一张照片可生成能说话、能唱歌跳舞的AI数字人。
T:0 – Airwallex 推出的 AI-native 自主财务平台
T:0 是 Airwallex 推出的 AI-native 自主财务平台,通过 Accountant、Tax Preparer、Integrator、Scout、CFO 五大智能体协作,从企业成立 Day 0 起端到端自动化记账、税务、合规、预测与财报。
Nano Banana 2 Lite – 谷歌推出的轻量级 AI 图像生成模型
Nano Banana 2 Lite 是谷歌推出的自研轻量级 AI 图像生成模型,定位速度优先的极速版,可在 4 秒内生成单张图像,每千张收费仅 0.034 美元。
LocateAnything – 英伟达推出的视觉语言定位模型
LocateAnything是英伟达推出的视觉语言定位模型,基于并行框解码技术,用户输入自然语言即可在图像中精准框选目标。模型支持多目标检测、GUI定位、OCR文本检测和点级指向等任务,推理速度达12.7 BPS(H100)。
Claude Sonnet 5 – Anthropic推出的最强智能体模型
Claude Sonnet 5是Anthropic推出的 Sonnet 系列中智能体能力最强的模型,支持制定计划、调用浏览器和终端等工具并自主运行。
TanStarter – AI 全栈框架,包含完整生产级 SaaS 基础
TanStarter 是基于 TanStack Start 全栈框架和 Cloudflare 边缘网络构建的 SaaS 启动模板,专为独立开发者和小团队设计。内置了完整的用户系统、支付(订阅/一次性)、数据库、文件存储、邮件、Newsletter、博客、后台管理和 AI 能力(文本、对话、生图、图片编辑),预置了定价页、关于页、联系页等常用页面。
FastContext -微软开源的轻量级代码仓库探索模型
FastContext 是微软开源的轻量级代码仓库探索模型,专为编程 Agent 设计。模型将仓库浏览与任务求解解耦,主 Agent 通过自然语言查询委托 FastContext 执行只读探索,后者并行调用 Read/Glob/Grep 工具,最终用紧凑的文件路径与行号引用()返回聚焦证据。
Krea 2 – Krea AI 推出首个从零训练的基础图像生成模型
Krea 2 是 Krea AI 推出的首个从零训练的基础图像生成模型,定位为"美学优先"的创意协作者。专注于视觉美学一致性、风格迁移和创意控制,而非单纯的提示词精确翻译。模型开源两个版本:RAW(未蒸馏基础模型,可塑性极强,适合训练 LoRA)和 Turbo(8步蒸馏模型,约2秒出图,支持 1K~2K 分辨率)。
HTML Anything – nexu-io 团队开源的 HTML 编辑器
HTML Anything 是 nexu-io 团队开源的 Agent 时代 HTML 编辑器,内置 75 套 Skill 模板覆盖杂志、演示、海报、小红书卡片等 9 种交付形态,可自动识别本地 18 种 Code Agent CLI 并复用已登录会话。
DSpark – DeepSeek 联合北京大学开源的推测解码加速框架
DSpark 是 DeepSeek 联合北京大学开源的推测解码加速框架,专门解决大模型自回归生成速度慢、像"挤牙膏"的痛点。采用半自回归生成架构,通过轻量级 Markov 头建模 token 间依赖,兼顾并行草稿的速度与连贯性;同时引入置信度调度验证,根据系统负载动态分配验证资源。
用箭头标注精准修改 AI 图片,Cowart 项目已获 2k+ Stars
今天发点适合做图片的东西。平时用 AI 生图,喜欢的风格可以搜,提示词也有现成参考,效果不满意就多生成几次。真正麻烦的是,成图已经有八九分满意,偏偏还有几个细节要改。和 AI 沟通时,既说不清具体位置,AI 也找不准修改对象,聊了好几轮,改错的地方反而越来越多。现在这个问题有办法绕过去了。GitHub 上的 Cowart 项目,直接把无限画布搬进了 Codex。
Penpot – 开源的设计与代码协作平台,多人实时协作
Penpot 是开源的设计与代码协作平台,基于 SVG、CSS、HTML 等开放标准构建,可在浏览器中完成 UI 设计与交互原型制作。平台支持多人实时协作、W3C Design Tokens 管理和 MCP Server 集成。
Papers with Code – AI科研平台,自动关联论文、代码等
Papers with Code 是整合论文、代码、数据集和排行榜的AI科研平台,核心使命是将学术论文与开源代码、SOTA 性能排行榜深度关联。平台聚合 arXiv 论文,自动链接 GitHub 仓库和 Hugging Face 模型,提供按任务分类的 SOTA 排行榜。
GPT-5.6 – OpenAI 推出的最新一代大语言模型系列
GPT-5.6 是 OpenAI 推出的最新一代大语言模型,目前受美国政府监管要求仅以"有限预览"形式向少数可信合作伙伴开放。系列首次采用天文学命名体系,推出三档型号:旗舰版 Sol(太阳)面向高难复杂任务,是目前性能最强的版本;均衡版 Terra(地球)性能对标 GPT-5.5 但价格仅一半,适合日常工作流;轻量版 Luna(月亮)主打速度与低成本。
PhoneBuddy – 腾讯混元开源的 4B 参数手机 Agent 模型
PhoneBuddy 是腾讯混元团队开源的 4B 参数手机 Agent 模型,核心研究如何在真实手机场景中训练可用的 AI Agent。
Mistral OCR 4 – Mistral AI 推出的最新一代文档理解模型
Mistral OCR 4 是 Mistral AI 推出的最新一代文档理解模型。模型支持从 PDF、图片、演示文稿等复杂文档中提取文本,能返回带边框定位、区域类型分类和置信度评分的结构化输出,支持 170 种语言,专为 RAG、智能体工作流和企业搜索等下游场景设计。
TRAE Work Design – TRAE Work 推出的全新设计模式
TRAE Work Design 是字节跳动旗下 AI 编程工具 TRAE Work 推出的全新设计模式,面向设计师、开发者、产品经理等角色,支持通过自然语言对话直接生成 UI 设计稿,可在画布中实时编辑修改。
粤公网安备 123456789号