多模態
Multimodal每天都會遇到除了讀字,還看得懂圖片、聽得懂聲音、看得懂影片的 AI。
就像
從只能用書信溝通,變成可以當面比手畫腳給它看。
大家常常誤會
以為要把東西「描述」給它聽。很多時候直接拍一張照片丟過去,比你花三分鐘打字形容準確得多。
所以呢
遇到講不清楚的東西(壞掉的機器、看不懂的表格、外文菜單),先想想能不能直接給它看。
除了讀字,還看得懂圖片、聽得懂聲音、看得懂影片的 AI。
從只能用書信溝通,變成可以當面比手畫腳給它看。
以為要把東西「描述」給它聽。很多時候直接拍一張照片丟過去,比你花三分鐘打字形容準確得多。
遇到講不清楚的東西(壞掉的機器、看不懂的表格、外文菜單),先想想能不能直接給它看。