LearnAI
模块 15 · 多模式人工智能(专业版) · 1/5
← 前往目录
任务

人工智能可以看到

多模态人工智能是否合适以及它会做什么?返回 JSON {"suitable": "是或否", "how": "如何申请"}。

解锁提交解决方案以供即时 AI 审核的权限。免费开始
多模态
💡 一个理论

现代模型不仅限于文本 - 它们是多模式的:它们理解图像,有些还理解音频和视频。你可以向模特展示一张收据照片、一个错误的屏幕截图、一张图表、一张图表——她会描述它、提取数据并进行解释。在幕后,图片也变成了标记(视觉)并落入与文本相同的上下文中。这开启了文本人工智能无法完成的任务:解析手写笔记、从屏幕截图中提取表格、了解照片中的问题。多模态是人工智能能够看到世界,而不仅仅是阅读世界。

如何评估·通过 70

  • 1周围没有文本的有效 JSON30%
  • 2有字段suitable和how35%
  • 3是 - 显示照片,将字段提取到结构中35%
您的提示Claude ⌄