Kimi多模态图片理解模型上新，视觉识别能力再升级，价格亲民！-手机游戏-中文科技资讯

近日，月之暗面科技公司宣布了一项重要更新，正式推出了其Kimi多模态图片理解模型API，并进一步完善了moonshot-v1模型系列的多模态处理能力。此次发布的全新多模态图片理解模型被命名为moonshot-v1-vision-preview（简称“Vision模型”）。

Vision模型以其强大的图像识别能力脱颖而出，能够精准捕捉图像中的复杂细节和细微差异。无论是食物还是动物，即便是相似度极高的对象，如蓝莓松饼和吉娃娃，该模型也能轻松区分和识别。在官方提供的一组测试图片中，Vision模型成功地将16张难以用肉眼分辨的蓝莓松饼和吉娃娃图片一一标记，准确率令人惊叹。

除了基本的图像识别功能外，Vision模型在OCR文字识别和图像理解方面同样表现出色。相较于传统的文件扫描和OCR识别软件，Vision模型在处理收据单、快递单等含有潦草手写内容的图像时，准确率更高。例如，在一张《某学生期末考试成绩》柱状图的识别测试中，Vision模型不仅能够准确提取出每个科目的分数数值并进行对比，还能识别出柱状图的样式、格式和颜色等细节。

在计费方式上，Vision模型采用了按量计费的模式，根据用户选择的模型不同，价格也有所差异。具体来说，单张图片按1024 tokens合并计算在Input请求的tokens用量中，moonshot-v1-8k-vision-preview模型的价格为每1M tokens 12元，moonshot-v1-32k-vision-preview模型的价格为每1M tokens 24元，而moonshot-v1-128k-vision-preview模型的价格则为每1M tokens 60元。

Vision模型还支持多种特性，包括多轮对话、流式输出、工具调用、JSON Mode和Partial Mode等。然而，也有一些功能目前暂未支持或部分支持，如联网搜索、带有图片内容的Context Caching以及URL格式的图片等。用户在使用时需注意这些限制。

在其他平台更新方面，月之暗面科技公司也推出了一系列新功能，如组织项目管理功能、一个企业实体认证多账号功能、File文件资源管理功能等。这些新功能的推出，将进一步提升用户的使用体验和便利性。同时，Context Caching功能已全面开放给所有用户，且Cache续期不再收取创建费用，这也为用户节省了不少成本。