Η Google αποκάλυψε το Lumiere, την τελευταία λέξη της τεχνολογίας σε ρεαλιστική τεχνητή νοημοσύνη που δημιουργεί κείμενο σε εικόνα και βίντεο. Το λογισμικό βελτιώνει σημαντικά την κίνηση χρησιμοποιώντας μια νέα προσέγγιση για τη δημιουργία καρέ βίντεο που δημιουργεί όλα τα καρέ σε ένα πέρασμα για να μετριάσει τα σφάλματα κίνησης.
Η γενετική εικόνα AI δημιουργεί εικόνες από κείμενο. Ένα κλειδί που το επιτρέπει είναι ο τεράστιος αριθμός διαδικτυακών εικόνων και βίντεο που διατίθενται για εκπαίδευση. Ένα άλλο είναι η ανάπτυξη μεθόδων για τη συσχέτιση όλων των λέξεων μιας γλώσσας μεταξύ τους μέσω διανυσμάτων. Επομένως, η τεχνητή νοημοσύνη μπορεί να κατανοήσει ως ένα ζευγάρι λέξεων ή σε μια πρόταση, το "είμαι" είναι πιο πιθανό από το "εγώ μονομερώς". Η τεχνητή νοημοσύνη δημιουργίας εικόνων, όπως το Stable Diffusion, συσχετίζει λέξεις με εικόνες αντικειμένων. Αυτή η τεχνητή νοημοσύνη κατανοεί ότι οι λέξεις «βασιλική κατοικία» συνδέονται πιο στενά με μια εικόνα «κάστρου» παρά με μια εικόνα «σπιτιού».
Το Generative video AI επεκτείνει το AI εικόνας για τη δημιουργία βίντεο από κείμενο. Οι ανταγωνιστές της Lumiere δημιουργούν πρώτα βασικά καρέ και μετά τα ενδιάμεσα πλαίσια. Αυτό είναι σαν ένα master animator που σχεδιάζει τις εικόνες αρχής και τέλους μιας βολής μπάσκετ και στη συνέχεια βάζει έναν βοηθό να σχεδιάζει τις εικόνες στο ενδιάμεσο. Το ζήτημα είναι ότι συχνά συμβαίνουν σφάλματα κίνησης επειδή οι ενδιάμεσες εικόνες δεν σχεδιάζονται σωστά, επομένως το Lumiere το παρακάμπτει δημιουργώντας όλα τα καρέ βίντεο χωρίς βασικό καρέ. Επίσης, το Lumiere έχει εκπαιδευτεί να γνωρίζει πώς μοιάζουν τα κινούμενα αντικείμενα σε διάφορα μεγέθη εικόνας, ώστε τα βίντεό της να φαίνονται ανώτερα.
Τεχνικά, το Lumiere χρησιμοποιεί πιθανοτικά μοντέλα διάχυσης για τη δημιουργία εικόνων σε συνδυασμό με ένα Space-Time U-Net, μια αρχιτεκτονική U-net με χρονική κλιμάκωση προς τα πάνω και προς τα κάτω, καθώς και μπλοκ προσοχής που προστίθενται στη συνηθισμένη κλίμακα ανάλυσης εικόνας. Η μείωση της κλίμακας χρονικά ταυτόχρονα με την ανάλυση μειώνει σημαντικά τους υπολογιστικούς φόρτους εργασίας, ενώ η αναβάθμιση σε συνδυασμό με ένα χρονικά συνειδητοποιημένο, χωρικό μοντέλο υπερ-ανάλυσης δημιουργεί την έξοδο υψηλής ανάλυσης. Ωστόσο, απαιτείται τμηματοποίηση πλαισίου εικόνας λόγω περιορισμών μνήμης, επομένως το Multidiffusion χρησιμοποιείται σε επικαλυπτόμενα όρια τμημάτων καρέ για να βοηθήσει στον μετριασμό των τεχνουργημάτων χρονικής κίνησης.
Το Lumiere μπορεί να συνδυαστεί με άλλη τεχνητή νοημοσύνη για να δημιουργήσει ένα ευρύτερο φάσμα αποτελέσματος. Αυτό περιλαμβάνει:
- Cinemagraphs - ένα τμήμα μιας εικόνας είναι κινούμενο
- Inpainting - ένα αντικείμενο σε ένα βίντεο αντικαθίσταται από ένα άλλο
- Stylized generation - η εμφάνιση αναδημιουργείται σε άλλο στυλ τέχνης
- Εικόνα σε βίντεο - μια επιθυμητή εικόνα είναι κινούμενη
- Βίντεο σε βίντεο – τα βίντεο δημιουργούνται ξανά με άλλο στυλ τέχνης
Η διάρκεια του βίντεο περιορίζεται στα 5 δευτερόλεπτα, ενώ η δυνατότητα δημιουργίας μεταβάσεων βίντεο και πολλαπλών γωνιών κάμερας είναι ανύπαρκτη. Οι αναγνώστες που ενδιαφέρονται να πειραματιστούν με γενετική τεχνητή νοημοσύνη στους επιτραπέζιους υπολογιστές τους θα πρέπει να αναβαθμίσουν σε μια ισχυρή κάρτα βίντεο (όπως αυτή στο Amazon) για την καλύτερη απόδοση κατά τη διάρκεια της προπόνησης.

follow us
Για να μην χάνεις τα νέα μας ακολούθησε μας στο Google News, αλλά και σε Facebook, Instagram, Youtube




