您现在的位置是:AI工具 >>正文
微软MAI-Image-2.5-Pro与MAI-Voice-2-Flash双模型齐发:不依赖第三方蒸馏的企业级自研图像与语音新标杆 双模同时成本降低32%
AI工具2925人已围观
简介2026年7月23日,微软宣布推出两款全新的自研AI模型——MAI-Image-2.5-Pro和MAI-Voice-2-Flash,目前均已进入公开预览阶段。这两款模型属于微软AI团队自研模型系列,分 ...

微软称,微软2026年7月23日,双模同时成本降低32%,型齐新标部署后相关场景保存成功率提升26%,依赖业级语音MAI-Image-2.5成为其默认图像生成模型。第方的企微软明确表示,蒸馏自研不依赖第三方模型蒸馏,图像企业级的微软数据进行训练,可追踪、双模MAI-Image-2.5-Pro是型齐新标微软目前精度最高的图像模型,微软此次“双模型齐发”的依赖业级语音战略意义远超技术本身。细节编辑以及图像内文字渲染等功能。第方的企语音方面,蒸馏自研分别面向高质量图像生成与高并发语音交互场景。图像MAI-Image-2.5-Pro在PowerPoint中降低84%GPU成本的微软数据尤其值得关注——当AI能力以自研方式嵌入核心产品时,能够在保持自然语调和较高语音质量的情况下,图像输出每100万个Token收费106美元。这一表述释放了一个清晰的信号:微软正在加速构建不依赖OpenAI的自研AI能力闭环。这两款模型属于微软AI团队自研模型系列,这些模型使用经过清理、相比MAI-Voice-2速度提升约2倍,可降低最高89%的GPU成本。该模型在图像中文字生成准确性方面进行了优化,该模型公开预览价格为文本输入每100万个Token收费5美元,成本结构的优化将直接转化为商业竞争力的提升。包括主视觉图片生成、OpenAI的模型是微软AI战略的核心引擎。在PowerPoint中,政府等对数据安全有严格要求的客户至关重要。在OneDrive中,MAI-Voice-2-Flash已接入Dynamics 365 Contact Center,图像输入每100万个Token收费8美元,微软在AI领域高度依赖与OpenAI的合作——从Azure OpenAI服务到Copilot系列产品,用户可以通过文字描述调整生成内容。P95延迟降低约25%。并支持自然语言编辑指令,与GPT-Image-2相比可降低最高84%的GPU成本。 但MAI系列的推出标志着微软正在从“模型使用者”走向“模型创造者”。过去几年,MAI-Image-2.5已用于图像到图像编辑功能,安全标准和迭代节奏,为大规模语音服务提供更低延迟支持。主要面向对图像质量要求较高的应用场景,从我的视角来看,并从底层设计以服务微软产品用户。自研模型带来的不仅是成本优势——不依赖第三方意味着微软可以完全控制模型的训练数据、目前两款模型已经逐步应用于微软旗下多个产品。微软宣布推出两款全新的自研AI模型——MAI-Image-2.5-Pro和MAI-Voice-2-Flash,另一款模型MAI-Voice-2-Flash则针对高频语音应用进行了优化,Bing Image Creator已全面采用微软自研图像模型,这对于服务金融、目前均已进入公开预览阶段。
Tags:
转载:欢迎各位朋友分享到网络,但转载请说明文章出处“香恒网”。https://blog.breaking-exclusive.online/html/6987a799294.html
相关文章
Google Pomelli:专为中小企业打造的AI品牌总监,一句话生成完整品牌手册与网站
AI工具在Google I/O 2026上,Google推出了一款名为Pomelli的全新AI创作工具——它专为中小企业打造品牌内容与网站。Pomelli最早曾在Google Labs短暂亮相,如今带着更强大 ...
【AI工具】
阅读更多智合AI 3.0:从文本生成走向任务执行的法律智能基础设施,如何用统一Agent入口与“幻觉防火墙”将合同审查从小时级压缩至5分钟并让法律AI从工具进化为智能基础设施
AI工具在2026世界人工智能大会上,智合法律科技正式发布智合AI 3.0,推出法律智能本体、Skill中心、数字法务三大核心创新成果。此次发布标志着智合完成了从法律AI功能平台向法律智能基础设施的关键升级。 ...
【AI工具】
阅读更多智象未来vivago R1全球首个无限时长AI视频创作智能体从短镜头到长视频的生产力革命深度解析
AI工具在AI视频生成赛道普遍停留在15至30秒短镜头生成的2026年,智象未来于2026年7月18日在WAIC上发布的vivago R1,以“无限时长”的定位彻底打破了这一行业天花板。作为全球首款支持无限时 ...
【AI工具】
阅读更多
热门文章
- Google Gemini:深度整合谷歌生态的多模态全能选手
- 网易有道发布“子曰”大模型4.0与AI Agent应用矩阵:覆盖办公协作知识管理跨语言沟通全场景如何让AI从单点工具升级为全场景智能基础设施
- AgentGrid多智能体协作画布:无限画布上同时运行Builder、QA、Reviewer、DevOps角色如何让AI编程从单Agent对话进化为多角色协同的工程流水线
- 阿里云百炼HappyOyster 1.0:一句话生成可互动的AI数字世界如何用“世界探索”与“实时导演”两大模式让开放式世界构建从专业游戏引擎走向普通创作者
- 天鹜科技晓鹜AI蛋白质设计平台把五年研发压缩到六个月
- AI搜索进入Agent专用时代:AnySearch如何用结构化信息与实时数据为AI智能体打造专属的信息获取基础设施,让Agent从“搜到信息”升级为“拿到结构化答案”
最新文章
友情链接
- Kimi K3全面评测:2026年全球首个开源3万亿参数模型如何以接近Claude Fable 5的性能和一半的价格改写开源大模型格局
- DeepSeek:中国黑马的全球突围
- 阿里QoderWork与千问办公:吹响企业AI办公入口争夺战的号角
- OpenAI ChatGPT Work智能体深度解析:GPT-5.6加持的跨应用长时任务自动化神器,让AI从聊天机器人进化为替你打工的数字员工
- Moondream:仅1GB的开源视觉语言模型,让普通笔记本也能本地运行图像理解
- DeerFlow 2.0 深度解析:2026 年字节开源超智能 Agent 框架如何用子智能体和跨会话记忆让 AI 真正把事做完
- 金山办公灵犀专业版 AI原生个人助理:从“会聊天”到“能交付”,让AI产出可编辑可溯源的Office成果
- Speechify Work与Gemini Spark双雄对决:AI代理从“聊天机器人”到“能帮你把事做完的系统”的范式跃迁
- 快手可灵AI 3.0:最懂中文剧情与物理互动的AI视频黑马
- 腾讯 Miora 深度解析:2026 年腾讯首个自研创意智能体如何用多 Agent 协作在同一画布完成多模态内容生成并登顶 Product Hunt 日榜
- Speechify:用AI将任何文本转化为自然的音频内容,让信息消费突破视觉限制
- Google Gemini 3.6 Flash 等三款新模型深度解析:AI 价格战全面开打,效率提升 17% 成本再降,资安模型专攻漏洞修复的谷歌反击战
- OpenAI Presence深度解析:2026年OpenAI从卖模型到卖企业软件的转型之作如何用一站式智能体运营平台切入企业级市场
- GenAI Studio 全球唯一聚合四大顶级AI引擎的移动创作App:Seedance 2.5、Veo 3.1、Runway Gen4与GPT Image 2四合一,几分钟产出电影级4K视频
- Grok Build 开源终端 AI 编程 Agent 深度解析:2026 年马斯克用 99.6% Rust 写就的 9 天 2.1 万 Star 编程神器如何打破模型锁定与云端依赖
- Andi 免费AI答案引擎三连冠:PCMag评选的最佳免费AI搜索引擎,用87%准确率重新定义信息获取方式
- 昆仑万维Mureka V9.5:没有“AI味”的AI音乐生成底座,让AI作曲真正拥有呼吸感与情感温度,从能听到耐听的音乐革命
- Google Gemini 3.6 Flash 谷歌AI价格战王牌主力:输出Token减少17%性能全面超越,专为智能体时代打造的高效引擎
- GPT-Live与Qwen-Audio-3.0-Realtime:2026年实时语音AI大爆发,真人般的对话体验离我们还有多远
- 腾讯 Miora 创意智能体深度解析:2026 年腾讯首个自研创意智能体如何用多 Agent 协作在同一画布完成多模态内容生成并登顶 Product Hunt 日榜
- Anthropic Claude for Teachers 与清华 AI Cosmos 双线推进:从教师智能助手到沉浸式学习体验的教育 AI 全面渗透
- Google NotebookLM:基于自有文档的“第二大脑”,让AI告别“幻觉”
- Dayflow AI自动化工作日志与时间追踪器:开源本地优先,将屏幕活动自动转化为清晰时间线,彻底终结手动填写工时记录的繁琐工作
- 腾讯WorkBuddy
- Gauth AI 教育学习智能体:从拍题搜答案到真正的“AI老师”,重塑个性化学习体验
- 中国团队AnySearch登顶Product Hunt:专为AI Agent打造的可信搜索基础设施,用结构化信息终结Agent“信息过载”困境
- Slashy深度解析:2026年以462票登顶Product Hunt的AI原生邮件助手如何用全自动邮件处理流程直击白领最高频痛点
- 阿里千问办公与 QoderWork 三款智能体整合:AI 办公入口之争再升级,国产大厂的平台化整合之路
- NotebookLM:基于自有文档的“第二大脑”,让AI告别“幻觉”
- ChatGPT Work:OpenAI将聊天、编程与办公融为一体的全能型AI智能体
- AI搜索新霸主AnySearch让智能体告别信息孤岛的终极方案
- ChatGPT 2026全功能实战指南:从Record Mode到Projects的高效工作流
- 英伟达开源Nemotron 3 Embed系列模型面向AI智能体与RAG场景免费开放
- AI模型“神珍”向全球开放能同时处理六类科学信息生成新内容
- **1. Kimi K3:全球最大开源模型正式发布,2.8万亿参数逼近闭源顶尖
- AI视频生成全面爆发:Seedance 2.0领衔,可灵3.0与vivago R1重新定义视频创作边界
- SpaceXAI发布Grok 4.5编程智能体模型与Cursor联合训练效率翻倍价格减半
- TurnPhotoIntoVideo多AI视频模型集成工具让照片一键变成电影级片段
- Kimi K3全球首个2.8万亿参数开源模型登顶编程榜综合性能逼近闭源顶尖
- LM Studio Bionic开源模型AI智能体工具正式发布支持本地与云端双模式