Spark-ASR-2.0 – 讯飞推出的最新一代语音识别大模型
Spark-ASR-2.0是讯飞基于星火语音基座大模型Spark-Audio的最新一代语音识别大模型。模型采用"非自回归+LLM增强自回归"协同架构,实现中英文混合、方言、专业术语、高噪小音量等复杂场景识别,效果超业界最优水平,推理成本仅增10%。
Ok Work – 百度推出的 AI 随身办公工具
Ok Work 是百度推出的轻量化AI随身办公工具,主打碎片化办公场景。Ok Work 集AI PPT、AI写作、AI表格、AI生图四大功能于一体,内置海量模板支持做同款。
Qwen-Audio-3.1 – 阿里通义推出的语音大模型系列
Qwen-Audio-3.1 是通义千问推出的语音大模型系列,包含五款模型:ASR 语音识别、ASR-Next 音频理解、TTS 语音合成、TTS-Next 音频创作、Realtime 实时交互,覆盖理解-生成-交互-创作全链条。
TeleOCR – 中国电信星辰实验室开源的文档解析模型
TeleOCR 是中国电信星辰实验室开源的文档解析模型,采用约 1.2B 参数轻量级视觉语言架构,在单一框架内统一处理数字文档与相机拍摄文档,可将文字、版面、表格、公式和科学图表解析为 Markdown、JSON 等结构化结果。
PatentFig AI – AI 专利附图生成器,照片一键生成专利图
PatentFig AI 是面向专利律师、代理人、企业IP团队与独立发明人的AI专利绘图软件。用户输入一段文字描述发明要点,或上传产品照片、手绘草图、CAD截图、3D模型,可自动生成符合专利局规范的附图,包括线条图、多视图图集、爆炸/剖面图、3D渲染图及流程框图。
Ming-Image-0.1-Design – 蚂蚁开源的图像生成模型
Ming-Image-0.1-Design是蚂蚁集团InclusionAI开源的6B图像生成模型,专注设计场景,支持8K长结构化提示词,能端到端生成UI、信息图、海报等完整视觉设计,配合同步开源的Design-Layer模型,可将设计图拆解为2—9个可独立编辑的透明图层,实现生成—分层—编辑—交付全流程。
MusicBuddy – 腾讯音乐推出的 AI 音乐创作平台
MusicBuddy是腾讯音乐推出的AI音乐创作平台,面向音乐人提供全链路服务。平台保留传统DAW分轨编辑形态,左侧嵌入AI对话面板,用自然语言可完成编曲调整、乐器替换、混响修改、改写歌词等操作。
Step Code – 阶跃星辰开源的终端编程智能体
Step Code 是阶跃星辰推出的开源终端编程智能体,采用 MIT License,可在终端中直接完成代码编写、调试、执行与交付。智能体在 Terminal Bench 2.1 评测中以 80.9% 通过率并列第一,Token 消耗为并列者中最低;自建 Multi-Frame 长程基准中也排名第一。
Jev 聊天助手 – 开源 AI 聊天辅助应用,生成最得体的回复
Jev 聊天助手是开源的非侵入式 AI 对话助手,可在微信、QQ、X、飞书等聊天时实时辅助回复。工具通过无障碍服务或离线 OCR 读取屏幕对话,先用判断模型分析对方意图与风险等级,再生成 3 条候选回复并排序,一键填入输入框,只填不发。
怎么用AI做论文配图?SciDraw AI一站式解决科研绘图难题
各位搞科研的朋友,大概都吃过配图的苦。
豆包工作「浏览器录制与回放」技能完整评测
现在 AI Agent 越来越多,但我发现一个挺尴尬的问题。很多时候,为了教会 AI 怎么干,比我自己干还麻烦。
Claude Opus 5.5 – Anthropic推出的最新旗舰模型
Claude Opus 5.5是Anthropic推出的Claude 5.5系列首款旗舰模型,性能对标自家Claude Fable 5.1。模型在Terminal-Bench 4.0(66.4%)、GDPval-AA v2.1(1846 Elo)等编程与知识工作基准上领先GPT-6 Astra;输入输出降价20%、缓存读取降60%,典型任务总成本省40%,输出快30%以上。
GPT-6 Sol – OpenAI 推出的中高端大模型
GPT-6 Sol 是 OpenAI 推出的中高端大模型,源自 GPT-6 Astra 底座,将 Astra 的推理、编程、事实性与 Agent 能力下放至更低价层级。模型 API 定价为输入 2 美元、输出 10 美元每百万 token,较上一代降价 50%。
GPT-6 Luna – OpenAI 推出的轻量级 AI 模型
GPT‑6 Luna 是 OpenAI 推出的轻量级模型,与 GPT‑6 Sol 同属 GPT‑6 Astra 的衍生版本,定位高频、规模化任务。模型 API 价格降至输入 0.1 美元、输出 0.5 美元每百万 token,比上一代便宜 50%,已进入 DeepSeek 腹地。
Qwen Intelligence – 阿里通义推出的AI手机全栈解决方案
Qwen Intelligence是阿里巴巴通义千问团队推出的AI手机全栈解决方案,能为手机厂商提供模型、平台与场景化方案。Qwen Intelligence包含三大Agent:Mobile Planner负责任务规划与决策,Mobile-Use执行手机操作,Mobile Creative面向影像创作,性能均达行业SOTA。
Hy Image3.5 preview – 腾讯混元推出的专业级生图模型
Hy Image3.5 preview是腾讯混元推出的高性价比专业级生图模型,支持文生图与图生图,可上传最多5张参考图,输出最高2K分辨率,支持多轮对话式连续创作编辑。
Xiaomi MiMo-V2.6 – 小米开源的全模态模型系列
Xiaomi MiMo-V2.6 是小米发布并开源的全模态模型系列,包含 Pro 和 Flash 两个原生全模态模型,主打以可验证复杂任务为核心的大规模 Agentic 强化学习。
Grok 4.7 – SpaceXAI 推出的最新旗舰大模型
Grok 4.7 是 SpaceXAI 推出的最新旗舰大模型,定位为最强编码与知识工作模型。模型换用更大的基座模型,强化长程任务、自我验证与长上下文管理能力,在 CursorBench、Terminal-Bench、法律及电气工程等基准上大幅超越前代 Grok 4.6。
Kimi Code Desktop – Kimi 推出的 Kimi Code 桌面客户端
Kimi Code Desktop 是 Kimi Code 的官方桌面客户端,支持 macOS 和 Windows 系统。工具将 Kimi Code 的 AI Agent 编程能力带入图形化界面,开发者可通过对话让 AI 读写代码、运行命令、完成自动化任务。
Jev Search – 开源 AI 搜索引擎,调用 Jev 模型自动分析
Jev Search 是 Search1API 团队开源的 AI 搜索引擎,基于 TypeSafe 的 Jev 模型。用户用大白话提问,Jev 能自动理解意图、选择来源、限定时间并生成查询词,Search1API 同时并行调用 Google、Reddit、Hacker News、arXiv 等 12 个引擎。
粤公网安备 123456789号