{"id":10992,"date":"2021-10-13T07:00:00","date_gmt":"2021-10-13T15:00:00","guid":{"rendered":"https:\/\/formtek.com\/blog\/?p=10992"},"modified":"2021-06-10T11:12:20","modified_gmt":"2021-06-10T19:12:20","slug":"multi-modal-ai-algorithms-that-use-audio-visual-and-tactile-data","status":"publish","type":"post","link":"https:\/\/formtek.com\/blog\/multi-modal-ai-algorithms-that-use-audio-visual-and-tactile-data\/","title":{"rendered":"Multi-Modal AI: Algorithms That Use Audio, Visual and Tactile Data"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\">Computers are mastering how to interpret images and audio. Increasingly AI models are incorporating not just a single sensory set of data, like for vision, sound, and touch, but as an aggregate of information from multiple sources, something being called multi-modal AI, and the result is a smarter AI algorithm.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Multi-modal AI is the ability for AI to process and draw relationships between different types of data.  One example is the <a href=\"https:\/\/www.forbes.com\/sites\/robtoews\/2021\/01\/18\/ai-and-creativity-why-openais-latest-model-is-a-big-deal\/?sh=6524289e5cb3\" data-type=\"URL\" data-id=\"https:\/\/www.forbes.com\/sites\/robtoews\/2021\/01\/18\/ai-and-creativity-why-openais-latest-model-is-a-big-deal\/?sh=6524289e5cb3\">DALL-E model by OpenAI<\/a> that can generate images based on textual input.  By combining the inputs from language, the algorithm can choose visual objects and render them as an original image.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><a href=\"https:\/\/en.wikipedia.org\/wiki\/Ilya_Sutskever\" data-type=\"URL\" data-id=\"https:\/\/en.wikipedia.org\/wiki\/Ilya_Sutskever\">Ilya Sutskever<\/a>, co-founder of OpenAI, <a href=\"https:\/\/www.newscientist.com\/article\/2264022-ai-illustrator-draws-imaginative-pictures-to-go-with-text-captions\/\" data-type=\"URL\" data-id=\"https:\/\/www.newscientist.com\/article\/2264022-ai-illustrator-draws-imaginative-pictures-to-go-with-text-captions\/\">said that<\/a> &#8220;the world isn\u2019t just text. Humans don\u2019t just talk: we also see. A lot of important context comes from looking.\u201d<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><a href=\"https:\/\/www.cc.gatech.edu\/people\/mark-riedl\" data-type=\"URL\" data-id=\"https:\/\/www.cc.gatech.edu\/people\/mark-riedl\">Mark Riedl<\/a> at the Georgia Institute of Technology, <a href=\"https:\/\/www.newscientist.com\/article\/2264022-ai-illustrator-draws-imaginative-pictures-to-go-with-text-captions\/\" data-type=\"URL\" data-id=\"https:\/\/www.newscientist.com\/article\/2264022-ai-illustrator-draws-imaginative-pictures-to-go-with-text-captions\/\">said that<\/a> \u201cthe more concepts that a system is able to sensibly blend together, the more likely the AI system both understands the semantics of the request and can demonstrate that understanding creatively.&#8221;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Jeff Dean, AI chief at Google, <a href=\"https:\/\/venturebeat.com\/2020\/12\/30\/multimodal-systems-hold-immense-promise-once-they-overcome-technical-challenges\/\" data-type=\"URL\" data-id=\"https:\/\/venturebeat.com\/2020\/12\/30\/multimodal-systems-hold-immense-promise-once-they-overcome-technical-challenges\/\">said that<\/a> \u201cthat whole research thread, I think, has been quite fruitful in terms of actually yielding machine learning models that do more sophisticated NLP tasks than we used to be able to do. We\u2019d still like to be able to do much more contextual kinds of models.\u201d<\/p>\n<div class=\"lightsocial_container\"><div class=\"lightsocial_element\"><a class=\"lightsocial_a\" href=\"http:\/\/digg.com\/submit?url=https%3A%2F%2Fformtek.com%2Fblog%2Fmulti-modal-ai-algorithms-that-use-audio-visual-and-tactile-data%2F&amp;title=\" target=\"_blank\"><img decoding=\"async\" class=\"lightsocial_img\" src=\"https:\/\/formtek.com\/blog\/wp-content\/plugins\/light-social\/digg.png\" alt=\"Digg This\" title=\"Digg This\" \/><\/a><\/div><div class=\"lightsocial_element\"><a class=\"lightsocial_a\" href=\"http:\/\/www.reddit.com\/submit?url=https%3A%2F%2Fformtek.com%2Fblog%2Fmulti-modal-ai-algorithms-that-use-audio-visual-and-tactile-data%2F&amp;title=\" target=\"_blank\"><img decoding=\"async\" class=\"lightsocial_img\" src=\"https:\/\/formtek.com\/blog\/wp-content\/plugins\/light-social\/reddit.png\" alt=\"Reddit This\" title=\"Reddit This\" \/><\/a><\/div><div class=\"lightsocial_element\"><a class=\"lightsocial_a\" href=\"http:\/\/www.stumbleupon.com\/submit?url=https%3A%2F%2Fformtek.com%2Fblog%2Fmulti-modal-ai-algorithms-that-use-audio-visual-and-tactile-data%2F&amp;title=\" target=\"_blank\"><img decoding=\"async\" class=\"lightsocial_img\" src=\"https:\/\/formtek.com\/blog\/wp-content\/plugins\/light-social\/stumbleupon.png\" alt=\"Stumble Now!\" title=\"Stumble Now!\" \/><\/a><\/div><div class=\"lightsocial_element\"><a class=\"lightsocial_a\" href=\"http:\/\/buzz.yahoo.com\/buzz?targetUrl=https%3A%2F%2Fformtek.com%2Fblog%2Fmulti-modal-ai-algorithms-that-use-audio-visual-and-tactile-data%2F&amp;headline=\" target=\"_blank\"><img decoding=\"async\" class=\"lightsocial_img\" src=\"https:\/\/formtek.com\/blog\/wp-content\/plugins\/light-social\/yahoo_buzz.png\" alt=\"Buzz This\" title=\"Buzz This\" \/><\/a><\/div><div class=\"lightsocial_element\"><a class=\"lightsocial_a\" href=\"http:\/\/www.dzone.com\/links\/add.html?title=&amp;url=https%3A%2F%2Fformtek.com%2Fblog%2Fmulti-modal-ai-algorithms-that-use-audio-visual-and-tactile-data%2F\" target=\"_blank\"><img decoding=\"async\" class=\"lightsocial_img\" src=\"https:\/\/formtek.com\/blog\/wp-content\/plugins\/light-social\/dzone.png\" alt=\"Vote on DZone\" title=\"Vote on DZone\" \/><\/a><\/div><div class=\"lightsocial_element\"><a class=\"lightsocial_a\" href=\"http:\/\/www.facebook.com\/sharer.php?t=&amp;u=https%3A%2F%2Fformtek.com%2Fblog%2Fmulti-modal-ai-algorithms-that-use-audio-visual-and-tactile-data%2F\" target=\"_blank\"><img decoding=\"async\" class=\"lightsocial_img\" src=\"https:\/\/formtek.com\/blog\/wp-content\/plugins\/light-social\/facebook.png\" alt=\"Share on Facebook\" title=\"Share on Facebook\" \/><\/a><\/div><div class=\"lightsocial_element\"><a class=\"lightsocial_a\" href=\"http:\/\/delicious.com\/save?title=&amp;url=https%3A%2F%2Fformtek.com%2Fblog%2Fmulti-modal-ai-algorithms-that-use-audio-visual-and-tactile-data%2F\" target=\"_blank\"><img decoding=\"async\" class=\"lightsocial_img\" src=\"https:\/\/formtek.com\/blog\/wp-content\/plugins\/light-social\/delicious.png\" alt=\"Bookmark this on Delicious\" title=\"Bookmark this on Delicious\" \/><\/a><\/div><div class=\"lightsocial_element\"><a class=\"lightsocial_a\" href=\"http:\/\/www.dotnetkicks.com\/kick\/?title=&amp;url=https%3A%2F%2Fformtek.com%2Fblog%2Fmulti-modal-ai-algorithms-that-use-audio-visual-and-tactile-data%2F\" target=\"_blank\"><img decoding=\"async\" class=\"lightsocial_img\" src=\"https:\/\/formtek.com\/blog\/wp-content\/plugins\/light-social\/dotnetkicks.png\" alt=\"Kick It on DotNetKicks.com\" title=\"Kick It on DotNetKicks.com\" \/><\/a><\/div><div class=\"lightsocial_element\"><a class=\"lightsocial_a\" href=\"http:\/\/dotnetshoutout.com\/Submit?title=&amp;url=https%3A%2F%2Fformtek.com%2Fblog%2Fmulti-modal-ai-algorithms-that-use-audio-visual-and-tactile-data%2F\" target=\"_blank\"><img decoding=\"async\" class=\"lightsocial_img\" src=\"https:\/\/formtek.com\/blog\/wp-content\/plugins\/light-social\/dotnetshoutout.png\" alt=\"Shout it\" title=\"Shout it\" \/><\/a><\/div><div class=\"lightsocial_element\"><a class=\"lightsocial_a\" href=\"http:\/\/www.linkedin.com\/shareArticle?mini=true&amp;url=https%3A%2F%2Fformtek.com%2Fblog%2Fmulti-modal-ai-algorithms-that-use-audio-visual-and-tactile-data%2F&amp;title=&amp;summary=&amp;source=\" target=\"_blank\"><img decoding=\"async\" class=\"lightsocial_img\" src=\"https:\/\/formtek.com\/blog\/wp-content\/plugins\/light-social\/linkedin.png\" alt=\"Share on LinkedIn\" title=\"Share on LinkedIn\" \/><\/a><\/div><div class=\"lightsocial_element\"><a class=\"lightsocial_a\" href=\"http:\/\/www.technorati.com\/faves?add=https%3A%2F%2Fformtek.com%2Fblog%2Fmulti-modal-ai-algorithms-that-use-audio-visual-and-tactile-data%2F\" target=\"_blank\"><img decoding=\"async\" class=\"lightsocial_img\" src=\"https:\/\/formtek.com\/blog\/wp-content\/plugins\/light-social\/technorati.png\" alt=\"Bookmark this on Technorati\" title=\"Bookmark this on Technorati\" \/><\/a><\/div><div class=\"lightsocial_element\"><a class=\"lightsocial_a\" href=\"http:\/\/twitter.com\/home?status=Reading+https%3A%2F%2Fformtek.com%2Fblog%2Fmulti-modal-ai-algorithms-that-use-audio-visual-and-tactile-data%2F\" target=\"_blank\"><img decoding=\"async\" class=\"lightsocial_img\" src=\"https:\/\/formtek.com\/blog\/wp-content\/plugins\/light-social\/twitter.png\" alt=\"Post on Twitter\" title=\"Post on Twitter\" \/><\/a><\/div><div class=\"lightsocial_element\"><a class=\"lightsocial_a\" href=\"http:\/\/www.google.com\/buzz\/post?url=https%3A%2F%2Fformtek.com%2Fblog%2Fmulti-modal-ai-algorithms-that-use-audio-visual-and-tactile-data%2F\" target=\"_blank\"><img decoding=\"async\" class=\"lightsocial_img\" src=\"https:\/\/formtek.com\/blog\/wp-content\/plugins\/light-social\/google_buzz.png\" alt=\"Google Buzz (aka. Google Reader)\" title=\"Google Buzz (aka. Google Reader)\" \/><\/a><\/div><\/div>","protected":false},"excerpt":{"rendered":"<p>Computers are mastering how to interpret images and audio. Increasingly AI models are incorporating not just a single sensory set of data, like for vision, sound, and touch, but as an aggregate of information from multiple sources, something being called<span class=\"ellipsis\">&hellip;<\/span><\/p>\n<div class=\"read-more\"><a href=\"https:\/\/formtek.com\/blog\/multi-modal-ai-algorithms-that-use-audio-visual-and-tactile-data\/\">Read more &#8250;<\/a><\/div>\n<p><!-- end of .read-more --><\/p>\n","protected":false},"author":2,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[69],"tags":[],"class_list":["post-10992","post","type-post","status-publish","format-standard","hentry","category-artificial-intelligence"],"_links":{"self":[{"href":"https:\/\/formtek.com\/blog\/wp-json\/wp\/v2\/posts\/10992","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/formtek.com\/blog\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/formtek.com\/blog\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/formtek.com\/blog\/wp-json\/wp\/v2\/users\/2"}],"replies":[{"embeddable":true,"href":"https:\/\/formtek.com\/blog\/wp-json\/wp\/v2\/comments?post=10992"}],"version-history":[{"count":2,"href":"https:\/\/formtek.com\/blog\/wp-json\/wp\/v2\/posts\/10992\/revisions"}],"predecessor-version":[{"id":10994,"href":"https:\/\/formtek.com\/blog\/wp-json\/wp\/v2\/posts\/10992\/revisions\/10994"}],"wp:attachment":[{"href":"https:\/\/formtek.com\/blog\/wp-json\/wp\/v2\/media?parent=10992"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/formtek.com\/blog\/wp-json\/wp\/v2\/categories?post=10992"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/formtek.com\/blog\/wp-json\/wp\/v2\/tags?post=10992"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}