用箭头标注精准修改 AI 图片,Cowart 项目已获 2k+ Stars
今天发点适合做图片的东西。平时用 AI 生图,喜欢的风格可以搜,提示词也有现成参考,效果不满意就多生成几次。真正麻烦的是,成图已经有八九分满意,偏偏还有几个细节要改。和 AI 沟通时,既说不清具体位置,AI 也找不准修改对象,聊了好几轮,改错的地方反而越来越多。现在这个问题有办法绕过去了。GitHub 上的 Cowart 项目,直接把无限画布搬进了 Codex。
Penpot – 开源的设计与代码协作平台,多人实时协作
Penpot 是开源的设计与代码协作平台,基于 SVG、CSS、HTML 等开放标准构建,可在浏览器中完成 UI 设计与交互原型制作。平台支持多人实时协作、W3C Design Tokens 管理和 MCP Server 集成。
Papers with Code – AI科研平台,自动关联论文、代码等
Papers with Code 是整合论文、代码、数据集和排行榜的AI科研平台,核心使命是将学术论文与开源代码、SOTA 性能排行榜深度关联。平台聚合 arXiv 论文,自动链接 GitHub 仓库和 Hugging Face 模型,提供按任务分类的 SOTA 排行榜。
GPT-5.6 – OpenAI 推出的最新一代大语言模型系列
GPT-5.6 是 OpenAI 推出的最新一代大语言模型,目前受美国政府监管要求仅以"有限预览"形式向少数可信合作伙伴开放。系列首次采用天文学命名体系,推出三档型号:旗舰版 Sol(太阳)面向高难复杂任务,是目前性能最强的版本;均衡版 Terra(地球)性能对标 GPT-5.5 但价格仅一半,适合日常工作流;轻量版 Luna(月亮)主打速度与低成本。
PhoneBuddy – 腾讯混元开源的 4B 参数手机 Agent 模型
PhoneBuddy 是腾讯混元团队开源的 4B 参数手机 Agent 模型,核心研究如何在真实手机场景中训练可用的 AI Agent。
Mistral OCR 4 – Mistral AI 推出的最新一代文档理解模型
Mistral OCR 4 是 Mistral AI 推出的最新一代文档理解模型。模型支持从 PDF、图片、演示文稿等复杂文档中提取文本,能返回带边框定位、区域类型分类和置信度评分的结构化输出,支持 170 种语言,专为 RAG、智能体工作流和企业搜索等下游场景设计。
TRAE Work Design – TRAE Work 推出的全新设计模式
TRAE Work Design 是字节跳动旗下 AI 编程工具 TRAE Work 推出的全新设计模式,面向设计师、开发者、产品经理等角色,支持通过自然语言对话直接生成 UI 设计稿,可在画布中实时编辑修改。
updream实测 – 画布式创作,一句话续写画面到成片
最近在 B 站刷到好多有意思的 AI 短剧。有 AI 动画,有悬疑短片,也有那种把网文脑洞拍出来的短剧。不管是内容、质量还是完成度,都比前两年高太多了。
Ponytail教程 – AI 编程 Agent 精简代码实战详解
今天发点适合写代码的东西。写项目的时候,刚开始代码都很清爽:两个页面、三个接口、几段工具函数,目录一眼能看完。
Ornith-1.0 – DeepReinforce 开源的 Agentic 编程系列模型
Ornith-1.0 是 DeepReinforce 团队推出的专为 Agentic 编程任务设计的开源大模型系列,模型基于 Gemma 4 与 Qwen 3.5 预训练基座,采用自改进训练框架,在代码生成与软件工程基准上达到同级别开源模型的 SOTA 水平。
QoderWork 中国版免费体验 – 从写作到远程操控电脑
AI Agent 全面爆发,但普通人想真正用起来却很难。海外工具成本高,网络不稳定,API 额度消耗太快,随便跑两个自动化工作流,钱包就有些吃不消。
向尾 – 阿里云推出的AI互动故事创作与阅读平台
向尾是阿里云推出的AI互动故事创作与阅读平台,主打创作与沉浸式互动。平台支持从零起稿、文稿续写、长篇小说分章规划三种模式,覆盖网文、剧本、儿童故事等场景。
学 AI 该学什么? – 图解 Skill:AI提效实战指南(PDF文件)
《图解Skill:AI提效实战指南》作者、开源项目 baoyu-skills 维护者,关于「我们学AI到底该学什么」的深度分享,核心主张是,当下学AI回报率最高的方向,不是追新模型、不是背提示词,而是把你自己反复做的事,变成AI能执行的技能(Agent Skills)。
Confucius4-TTS – 网易有道开源的多语言语音合成引擎
Confucius4-TTS 是网易有道开源的 1.3B 参数多语言语音合成引擎。模型只需 3 秒参考音频可零样本克隆音色,无需参考文本,支持中、英、日、韩等 14 种语言跨语种无口音合成,能迁移情感韵律。
MMSkills – 上海交大与小红书联合推出的多模态技能框架
MMSkills 是上海交通大学与小红书联合推出的面向通用视觉 Agent 的多模态技能框架,支持将可复用技能从纯文本步骤扩展为包含文本流程、运行时状态卡片和多视角关键帧的多模态程序性知识,通过 branch loading 机制在运行时高效调用视觉证据。
Otty – Typora 团队推出的原生 macOS 终端应用
Otty 是 Typora 团队推出的原生 macOS 终端应用,专为频繁使用 AI Agent 的开发者设计。工具在传统终端的基础上,原生集成多 Agent 面板管理、会话恢复、对话分支(Fork)和 Prompt 队列等功能,让用户在一个界面中同时运行和监控 Claude Code、Codex、OpenCode 等工具。
JoyAI-VL-Interaction – 京东开源的实时视频视觉语言交互模型
JoyAI-VL-Interaction 是京东 Joy Future Academy 开源的实时视频视觉语言交互模型,是全球首个全栈开源的 interaction 模型系统。
Honestly – AI 社交情报与联盟营销分析平台,抓取真实评论
Honestly 是面向品牌方的 AI 社交情报与联盟营销分析平台,核心定位是"将社交媒体上的真实产品讨论转化为可执行的商业信号"。通过爬取 Reddit、TikTok、YouTube、Instagram、X 等主流社交平台
Qwen-AgentWorld – 通义千问推出的原生语言世界模型
Qwen-AgentWorld 是通义千问团队推出的首个语言世界模型,通过长思维链推理模拟 MCP、搜索、终端、软件工程、Android、Web、操作系统共 7 大智能体环境。
Claude Tag – Anthropic 推出的企业级 AI 协作工具
Claude Tag 是 Anthropic 推出的企业级 AI 协作工具,定位为 Claude Code 的进化版。工具内置 Agent 身份深度集成 Slack,团队成员可在任意频道 @Claude 委派任务。
粤公网安备 123456789号