Food Portion Estimation: From Pixels to Calories
تستكشف هذه الورقة استراتيجيات متنوعة، بما في ذلك المدخلات المساعدة وتقنيات التعلم العميق، للتغلب على تحدي تقدير أحجام حصص الطعام ثلاثية الأبعاد من صور ثنائية الأبعاد من أجل تقييم غذائي دقيق والوقاية من الأمراض المزمنة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تخمين كمية الطعام الموجودة في طبق بمجرد النظر إلى صورة فوتوغرافية مسطحة. الأمر يشبه محاولة تخمين حجم جبل حقيقي بمجرد النظر إلى رسم له على ورقة. أنت تعلم أن الجبل ضخم، ولكن هل هو تلة صغيرة أم قمة شاهقة؟ بدون مسطرة أو جسم معروف للمقارنة به، من المستحيل معرفة ذلك بالتأكيد.
هذه الورقة البحثية، بعنوان "تقدير حصص الطعام: من البكسلات إلى السعرات الحرارية"، هي مراجعة لكيفية محاولة العلماء حل مشكلة "الصورة المسطحة مقابل الطعام الحقيقي". الهدف هو مساعدة الناس على تتبع ما يأكلونه للحفاظ على صحتهم، ولكن القيام بذلك بمجرد التقاط صورة أمر صعب لأن الكاميرات تفقد "العمق" (مدى بعد الأشياء) عندما تلتقط صورة ثنائية الأبعاد (2D).
إليك تفصيل للاستراتيجيات التي تناقشها الورقة، باستخدام تشبيهات بسيطة:
1. الطريقة القديمة: استخدام "المساطر السحرية" والكاميرات الخاصة
في البداية، حاول العلماء إصلاح مشكلة "الصورة المسطحة" بإضافة أدوات إضافية، تماماً مثل نجار يضيف مستوى (ميزان) إلى المنشار.
- مستشعرات العمق الخاصة: استخدمت بعض الأنظمة كاميرات خاصة (مثل Microsoft Kinect القديم) التي يمكنها رؤية "العمق" عن طريق إسقاط أنماط ضوئية غير مرئية على الطعام.
- العقبة: الأمر يشبه محاولة قياس مرآة أو وعاء من الحساء باستخدام الليزر؛ حيث ينعكس الضوء أو يختفي، مما يربك المستشعر. كما أن هذه الكاميرات الضخمة ليست شيئاً ترغب في حمله معك في كل وجبة.
- المسح بزاوية 360 درجة: طريقة أخرى طلبت من المستخدمين الدوران حول أطباقهم والتقاط صور عديدة، مثل مصور يطوف حول تمثال. يقوم الكمبيوتر بعد ذلك بتجميع هذه الصور معاً لبناء نموذج ثلاثي الأبعاد (3D).
- العقبة: هذا يتطلب مجهوداً كبيراً من شخص جائع. بالإضافة إلى ذلك، إذا كان الطعام طرياً أو مغطى بطعام آخر (الانسداد/الحجب)، لا يستطيع الكمبيوتر رؤية الأجزاء المخفية ويضطر للتخمين، مما يؤدي إلى أخطاء.
- مطابقة القوالب (Template Matching): هذا النهج يشبه محاولة وضع قطاعة الكوكيز على كتلة من العجين. يمتلك الكمبيوتر نموذجاً ثلاثي الأبعاد "قياسياً" لبرجر أو تفاحة "مثالية"، ويحاول تصغير أو تمديد هذا النموذج ليطابق الصورة.
- العقبة: الطعام الحقيقي فوضوي. إذا أخذ شخص قضمة من البرجر أو كان طرف الخبز مطوياً بشكل غريب، فإن "قطاعة الكوكيز" المثالية لن تتناسب معه، مما يؤدي إلى قياسات خاطئة.
2. الطريقة الجديدة: "التخمين فائق الذكاء" (التعلم العميق)
مؤخراً، توقف العلماء عن محاولة بناء نماذج ثلاثية الأبعاد مثالية وبدأوا في تعليم الحواسيب كيف تكون بارعة في التخمين. هذا هو التحول نحو "التعلم العميق" (Deep Learning).
- توقع العمق أحادي العدسة (Monocular Depth Prediction): بدلاً من الحاجة إلى كاميرا خاصة، ينظر الكمبيوتر إلى صورة واحدة ويستخدم ما "تعلمه" من ملايين صور الطعام الأخرى لتخمين العمق.
- التشبيه: الأمر يش like شيف خبير يمكنه النظر إلى كومة من المعكرونة ومعرفة كميتها فوراً بمجرد النظر إلى الشكل والظلال، دون الحاجة إلى قياسها. يتعلم الكمبيوتر قواعد "الظلال والأشكال" هذه من مجموعات بيانات ضخمة.
- الارتباط المباشر بالطاقة (Direct Energy Regression): بعض الأنظمة تتخطى عملية تخمين الثلاثي الأبعاد بالكامل. فهي تنظر إلى الصورة وتنتقل مباشرة للقول: "هذا يبدو وكأنه 300 سعرة حرارية".
- التشبيه: الأمر يشبه خبير تذوق النبيذ الذي يحدد فوراً سنة الإنتاج والسعر، بدلاً من تحليل التركيب الكيميائي أولاً.
- حقول الإشعاع العصبية (NeRFs): هذه هي التكنولوجيا الأكثر تطوراً. بدلاً من بناء شبكة ثلاثية الأبعاد صلبة، تعامل الطعام كأنه سحابة مستمرة من اللون والكثافة.
- التشبيه: تخيل هولوغرام يمكنه ملء الفراغات. حتى لو كنت ترى الجزء الأمامي من وعاء الحساء فقط، يمكن لهذه التكنولوجيا أن "تتخيل" الجزء الخلفي والسائل بالداخل بناءً على ما تعلمته حول كيفية ظهور الحساء عادةً، وهي تتعامل مع الأشياء الصعبة مثل البخار أو السوائل الشفافة بشكل أفضل من الطرق القديمة.
3. العقبات المتبقية
حتى مع وجود أدوات الذكاء الاصطناي المتطورة هذه، تشير الورقة إلى ثلاث مشكلات كبيرة لا تزال بحاجة إلى حل:
- مشكلة المقياس (مشكلة "أين المسطرة؟"): إذا رأيت بيتزا صغيرة في صورة، فهل هي بيتزا صغيرة قريبة من الكاميرا، أم بيتزا ضخمة بعيدة؟ الكمبيوتر لا يعرف ذلك ما لم يكن هناك جسم معروف في الصورة ليعمل كمسطرة. تشير الورقة إلى أن الذكاء الاصطناعي الحالي يعاني عندما لا توجد أشياء مألوفة للمقارنة بها.
- مشكلة الانسداد/الحجب (مشكلة "القاع المخفي"): لا يمكنك رؤية الجزء السفلي من الطعام الملامس للطبق، أو الحشوة داخل الساندوتش (البوريتو). يجب على الكمبيوتر تخمين ما هو مخفي.
- الفكرة المستقبلية: تقترح الورقة أن الذكاء الاصطناعي المستقبلي قد يستخدم "الإكمال غير المكتمل" (Amodal Completion)، وهو ما يشبه المحقق الذي يستخدم الأدلة لإعادة بناء مسرح جريمة لم يُرَ بالكامل. قد يتعلم أيضاً من عاداتك الغذائية الشخصية لتقديم تخمينات أفضل عما يوجد بالداخل.
- فجوة الكثافة (مشكلة "الهش مقابل الصلب"): الحجم ليس هو نفسه الوزن. الكرواسان الهش يشغل مساحة كبيرة ولكنه يحتوي على سعرات حرارية أقل من خبز "البيجل" الكثف الذي له نفس الحجم.
- الفكرة المستقبلية: تقترح الورقة استخدام ذكاء اصطنا-ي متقدم (نماذج اللغات الكبيرة) يمكنه قراءة الأوصاف النصية (مثل "منخفض الكربوهيدرات" أو "كثيف") جنباً إلى جنب مع الصورة لتحديد الوزن والسعرات الحرارية بدقة أكبر.
الخلاصة
تخلص الورقة إلى أننا انتقلنا من الحاجة إلى أجهزة ضخمة ومكلفة إلى استخدام برمجيات ذكية تعمل مع كاميرا الهاتف العادية. وبينما يجعل هذا الأمر أسهل بكثير بالنسبة للناس، إلا أنه ليس مثالياً بعد. التكنولوجيا تتحسن في تخمين الأجزاء المخفية ووزن الطعام، لكنها لا تزال تعاني عندما لا يوجد مرجع واضح لتخبرها بالحجم الحقيقي للطعام. الهدف هو جعل تتبع مدخول الطعام سهلاً مثل مجرد التقاط صورة، مما يساعد الناس على إدارة صحتهم دون عناء التسجيل اليدوي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.