语音技术
提供端到端语音语言大模型、语音识别、语音合成、声音复刻、语音翻译和智能语音会议等能力。
百度AI开放平台
用全栈AI能力构建智能应用百度AI开放平台面向开发者和企业提供语音、文字识别、人脸与人体、图像、语言与知识、视频及大模型等开放能力,并配套体验中心、开发文档、API在线调试和行业解决方案。
从语音交互、文档解析到视觉识别、语言理解和大模型开发,平台提供可体验、可调用、可集成的人工智能能力。
提供端到端语音语言大模型、语音识别、语音合成、声音复刻、语音翻译和智能语音会议等能力。
支持通用文字识别、办公文档识别、表格识别、手写文字识别、证件识别、票据识别和文档解析。
提供通用物体和场景识别、看图识万物、图像搜索、图像增强、人脸检测、活体检测和人体行为分析等能力。
提供文心大模型和百度千帆大模型平台,支持以大模型和Agent为基础开展企业级应用开发。
提供开发文档、SDK下载、API在线调试、AI能力体验中心、入门教程和教学视频,帮助开发者完成能力接入。
关注大模型文档翻译、端到端语音语言大模型和文档解析等公开发布信息,了解平台的新能力与版本进展。
支持多格式文档和200+语言互译,平台公开信息显示其面向复杂内容提供更快、更准确的翻译能力。
端到端语音语言大模型Pro版公开上线,平台介绍其支持更自然的语音交互体验。
公开资讯显示新版增强了文本、表格和公式解析能力。
平台提供AI能力体验中心、入门教程、文档中心、SDK下载、API在线调试、教学视频和开发者社区等资源。