【科技纵览】7月31日,人工智能初创企业MiniMax正式对外披露了其最新研发的通用全模态生成模型H3。这款新模型具备对文本、图像、视频及声音进行统一理解的深层能力,并能直接输出原生双声道音视频内容。在视频生成规格上,它最高支持长达15秒的2K分辨率画面。
H3的核心定位在于商用级多场景的内容生产。无论是在指令遵循的精准度,还是文字与品牌信息的呈现效果,乃至视频到视频的动作迁移表现上,该模型均展现出显著优势。这些特性使其能够广泛落地于广告营销、电子商务、品牌建设以及游戏开发等商业领域。
价格策略方面,H3展现出极强的竞争力。在2K分辨率下,其每秒生成成本不足主流模型的三分之一;而在768P分辨率下,这一比例也低于二分之一。支撑这一效能的技术底座包括Contextual Omni Representation、H3-VAE以及H3-Omni Transformer等核心组件。通过引入理解与生成异构的训练架构,系统训练吞吐量提升了近30%。
值得注意的是,MiniMax宣布将在未来数日内开放模型权重。此举旨在推动开源社区的繁荣发展,并加速国产芯片对该模型的适配进程。回顾此前两代产品,Hailuo 01与02分别在系统构建和架构效率上完成了迭代优化,而H3则进一步实现了任务与模态的深度统一。公司透露,后续版本将致力于推动与M系列模型能力的融合,并持续提升画面的精细度。从行业视角看,这种“高性能+低门槛+开源”的组合拳,或许正是大模型从技术演示走向大规模商业落地的关键转折点。
MiniMax发布全模态模型H3,开源权重加速国产芯片适配
科技区角
2026-07-31 13:31
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。