AI行业应用

AI行业应用, 自动驾驶

WayveScenes101:一个用于自动驾驶应用的高分辨率图像数据集

WayveScenes101,这是一个数据集,旨在帮助社区推进新颖视图合成的最新技术,该数据集专注于具有挑战性的驾驶场景,其中包含许多具有不断变化的几何和纹理的动态和可变形元素。

该数据集包含 101 个驾驶场景,涵盖各种环境条件和驾驶场景。该数据集专为野外驾驶场景的基准重建而设计,场景重建方法面临许多固有的挑战,包括图像眩光、快速曝光变化以及具有明显遮挡的高动态场景。

AI行业应用, 机器人

StockBot:由Llama3-70B驱动的实时股票数据聊天机器人

StockBot 是一款基于 ai 的聊天机器人,它利用 Groq 上的 Llama3 70b、Vercel 的 AI SDK 和 TradingView 的实时小部件,通过专门针对您的请求定制的实时交互式图表和界面进行对话响应。 StockBot由Groq 提供支持,闪电般快速的AI聊天机器人,可实时响应交互式股票图表、财务、新闻等。

它不仅能够展示每日市场表现热图、股票财务数据、价格历史和烛台图表,还能提供头条新闻和股票筛选器。它不仅支持股票,还涵盖了外汇、债券和加密货币,提供全面的市场分析。

AI行业应用, 多媒体处理

ElevenLabs 发布Turbo 2.5模型

该模型支持包括普通话在内的 32 种语言,能为全球近 80%的地区提供高质量、低延迟的 AI 对话;
首次支持越南语、匈牙利语和挪威语;
重点提高了印地语、法语、西班牙语、普通话等 27 种语言的响应速度,其中英语速度提高了 25%,最高提升达 3 倍;
结合先进技术和低延迟模型架构,可快速合成语音,保持流畅自然且高品质的音质,响应时间不超 400 毫秒。

AI行业应用, 多媒体处理

Emilia 一个开源多语言高质量语音数据集

港中大(深圳)联合中科院声学所、上海人工智能实验室等机构发布了超过10万小时包含6种语言的多样化的语音生成数据集—— Emilia!

Emilia是一个开源的多语种外语音数据集,专为大规模语音生成研究设计。它包含超过101,000小时的六种语言高质量语音数据和相应的文本转录,覆盖了各种说话风格和内容类型,如脱口秀、访谈、辩论、体育评论和有声书。

AI行业应用, 多媒体处理

DETECT-2B :音频深度伪造检测工具

etect-2B的子模型由带有关键层插入适配模块的冻结音频表示模型组成。这些适配模块专注于识别真实音频与伪造音频的细微差别——即录音中不经意留下的声音痕迹。大多数AI生成的音频片段听起来都“过于完美”。Detect-2B能够预测音频中AI制作的成分,而且无需每次听到新片段时都重新训练模型。这些子模型也经过了大型数据集的充分训练。

AI行业应用, 多媒体处理

StreamVC: 实时低延迟语音转换

StreamVC 即使在移动平台上也能以低延迟从输入信号生成结果波形,使其适用于呼叫和视频会议等实时通信场景,并解决这些场景中的语音匿名等用例。
谷歌的设计利用 SoundStream 神经音频编解码器的架构和训练策略来实现轻量级高质量语音合成。
谷歌证明了因果学习软语音单元的可行性,以及提供白化基频信息以提高音调稳定性而不泄漏源音色信息的有效性。

AI行业应用, 多媒体处理

这家人工智能公司希望彻底改变将对话重新配音成不同语言的方式

Flawless 是一家人工智能驱动的电影制作工作室,希望您在观看热门节目的同时还能在晚上安然入睡(不会出现不匹配的嘴巴动作和残酷的场景剪辑)。 Flawless 的专有技术 TrueSync 于 2018 年由多才多艺的导演斯科特·曼 (Scott Mann) 和尼克·莱恩斯 (Nick Lynes) 创立,它可以在演员的脸部上进行映射,并提供我们在人工智能狂野西部见过的最令人印象深刻的翻译。

退出移动版