Bước tới nội dung

Bộ nhớ dài-ngắn hạn

Bách khoa toàn thư mở Wikipedia
Mô hình một đơn vị LSTM
Mô hình một đơn vị LSTM. Đầu ra của nó sẽ trở thành đầu vào cho bước tiếp theo.

Bộ nhớ ngắn-dài hạn (tiếng Anh: long short-term memory, viết tắt: LSTM) là một kiến trúc mạng thần kinh hồi quy được thiết kế để học các phụ thuộc dài hạn trong dữ liệu tuần tự. LSTM được giới thiệu lần đầu năm 1997 bởi Sepp Hochreiter và Jürgen Schmidhuber nhằm giải quyết vấn đề gradient biến mất (vanishing gradient) vốn khiến các RNN truyền thống không thể học hiệu quả từ các chuỗi dài.[1]

Ý tưởng cốt lõi của LSTM là bổ sung một trạng thái ô nhớ (cell state) được điều phối bởi các cơ chế cổng (gate), cho phép mạng chọn lọc thông tin nào cần ghi nhớ, thông tin nào cần xóa, và thông tin nào cần xuất ra tại mỗi bước thời gian. Nhờ thiết kế này, LSTM có thể xử lý các chuỗi với khoảng cách phụ thuộc lên đến hàng nghìn bước, vượt xa giới hạn thực tế của RNN thông thường.[1]

LSTM có ứng dụng rộng rãi trong phân loại,[2][3] xử lý dữ liệu, các nhiệm vụ phân tích chuỗi thời gian,[4] nhận dạng giọng nói,[5][6] dịch máy,[7][8] phát hiện hoạt động giọng nói,[9] điều khiển robot,[10][11] trò chơi điện tử,[12][13] chăm sóc sức khỏe,[14] dự báo năng lượng.[15]

Lịch sử

[sửa | sửa mã nguồn]

Trước khi LSTM ra đời, xử lý ngôn ngữ tự nhiên và nhận dạng giọng nói chủ yếu dựa vào các phương pháp dựa trên quy luật (rule-based) hoặc thống kê. Trong dịch máy, các hệ thống dựa trên luật yêu cầu các nhà ngôn ngữ học xây dựng thủ công toàn bộ quy tắc ngữ pháp và từ điển song ngữ cho từng cặp ngôn ngữ, khiến toàn bộ quá trình trở tốn kém và khó mở rộng thêm các từ mới. Từ cuối thập niên 1980, dịch máy thống kê dần thay thế hướng tiếp cận này bằng cách học xác suất chuyển đổi từ các kho ngữ liệu song ngữ lớn, nhưng vẫn gặp khó khăn trong việc nắm bắt các phụ thuộc ngữ nghĩa dài hạn giữa các từ cách xa nhau trong câu.[16] Trong nhận dạng giọng nói, mô hình Markov ẩn kết hợp với mô hình hỗn hợp Gaussian (GMM-HMM) là hướng tiếp cận chủ đạo trong nhiều thập kỷ, nhưng bị giới hạn bởi giả định Markov rằng mỗi trạng thái chỉ phụ thuộc vào trạng thái ngay trước đó, khiến mô hình không thể nắm bắt các ngữ cảnh dài hơn trong lời nói tự nhiên.[17]

Mạng thần kinh hồi quy (RNN) được kỳ vọng sẽ khắc phục các giới hạn này nhờ khả năng xử lý chuỗi có độ dài tùy ý và lý thuyết có thể ghi nhớ thông tin từ các bước thời gian xa hơn. Tuy nhiên, khi huấn luyện RNN bằng lan truyền ngược qua thời gian, gradient có xu hướng giảm dần xuống 0 khi chuỗi kéo dài. Hiện tượng này được Sepp Hochreiter phân tích chính thức lần đầu trong luận văn tốt nghiệp năm 1991 tại Đại học Kỹ thuật Munich,[18] và sau đó được Yoshua Bengio, Patrice Simard và Paolo Frasconi làm rõ thêm vào năm 1994.[19] Hệ quả thực tế là RNN truyền thống gần như không thể học được các phụ thuộc (dependencies) cách nhau hơn vài chục bước thời gian, khiến chúng kém hiệu quả với các câu dài hay đoạn văn bản liên tục.[1]

Năm 1997, Hochreiter cùng người hướng dẫn Jürgen Schmidhuber công bố kiến trúc LSTM trên tạp chí Neural Computation, giải quyết vấn đề gradient biến mất bằng cách đưa vào một trạng thái ô nhớ truyền thông tin qua các bước thời gian mà không bị biến đổi trực tiếp bởi các phép nhân ma trận lặp lại.[1] Phiên bản LSTM ban đầu bao gồm cổng đầu vào và cổng đầu ra, nhưng chưa có cơ chế để xóa thông tin khỏi ô nhớ. Năm 1999, Felix Gers, Schmidhuber và Fred Cummins bổ sung cổng quên, cho phép mạng chủ động xóa thông tin không còn cần thiết và đặt lại trạng thái ô nhớ, và đây là phiên bản được sử dụng phổ biến nhất cho đến nay.[20] Năm 2000, nhóm tác giả tiếp tục bổ sung kết nối nhìn trộm (peephole connection), cho phép các cổng truy cập trực tiếp vào trạng thái ô nhớ thay vì chỉ gián tiếp qua trạng thái ẩn.[21]

Năm 2014, Kyunghyun Cho và các cộng sự đề xuất đơn vị hồi quy có cổng (gated recurrent unit, GRU), một biến thể đơn giản hơn của LSTM gộp cổng quên và cổng đầu vào thành một cổng cập nhật duy nhất, giảm số lượng tham số trong khi vẫn giữ hiệu suất tương đương trên nhiều tác vụ.[22] Cũng trong năm 2015, Srivastava, Greff và Schmidhuber áp dụng nguyên lý cổng của LSTM để xây dựng highway network, mở đường cho kiến trúc ResNet xuất hiện ngay sau đó.[23]

Kiến trúc

[sửa | sửa mã nguồn]
Kiến trúc cơ bản của một đơn vị LSTM.

LSTM chuẩn

[sửa | sửa mã nguồn]

Một đơn vị LSTM gồm một ô nhớ và ba cổng: cổng đầu vào (input gate), cổng đầu ra (output gate), và cổng quên (forget gate). Ô nhớ lưu trữ thông tin qua các bước thời gian tùy ý, trong khi các cổng điều tiết luồng thông tin vào và ra khỏi ô nhớ thông qua hàm sigmoid cho ra giá trị trong khoảng , trong đó 0 có nghĩa là chặn hoàn toàn và 1 có nghĩa là cho đầy đủ giá trị qua nguyên vẹn.

Tại mỗi bước thời gian , đơn vị LSTM nhận đầu vào và trạng thái ẩn từ bước trước , rồi tính toán theo thứ tự sau:

Cổng quên quyết định phần nào của trạng thái ô nhớ cần xóa bỏ. Nó nhìn vào và , rồi cho ra một vector giá trị trong khoảng (0, 1) cho mỗi chiều của :

Giá trị gần 0 nghĩa là "quên thông tin này", gần 1 nghĩa là "giữ lại thông tin này".

Cổng đầu vào quyết định thông tin mới nào sẽ được ghi vào ô nhớ. Nó gồm hai phần: cổng đầu vào kiểm soát mức độ cập nhật, và vector ứng viên chứa thông tin mới được đề xuất:

Trạng thái ô nhớ sau đó được cập nhật bằng cách kết hợp thông tin cũ (được lọc qua cổng quên) và thông tin mới (được lọc qua cổng đầu vào):

trong đó là tích Hadamard (nhân theo từng phần tử).

Cổng đầu ra quyết định phần nào của ô nhớ sẽ được xuất ra thành trạng thái ẩn :

trong đó là hàm sigmoid, và là hàm tanh. Các ma trận , và vector là các tham số học được trong quá trình huấn luyện.[1][20]

Peephole LSTM

[sửa | sửa mã nguồn]

Trong LSTM chuẩn, các cổng chỉ nhìn vào trạng thái ẩn $h_{t-1}$ và đầu vào $x_t$ để đưa ra quyết định, mà không trực tiếp quan sát trạng thái ô nhớ $c_{t-1}$. Năm 2000, Gers và Schmidhuber bổ sung kết nối nhìn trộm (peephole connection), cho phép cả ba cổng truy cập trực tiếp vào $c_{t-1}$, giúp mạng học được các phụ thuộc thời gian chính xác hơn.[21]

Lưu ý rằng cổng quên và cổng đầu vào sử dụng , trong khi cổng đầu ra sử dụng – tức là trạng thái ô nhớ đã được cập nhật tại bước hiện tại.[21]

Các biến thể kiến trúc

[sửa | sửa mã nguồn]
RNN chiều xuôi (bên trái) và chiều ngược (bên phải). Khi kết hợp cả hai ta có BiLSTM
LSTM xếp chồng 2 lớp với chiều thuận bên trái và chiều ngược bên phải. Khi kết hợp cả hai chiều ta có BiLSTM

Ngoài các thay đổi ở cấp độ công thức, LSTM còn được mở rộng theo hai hướng kiến trúc quan trọng. LSTM hai chiều (bidirectional LSTM, BiLSTM), được Graves và Schmidhuber giới thiệu năm 2005, chạy hai đơn vị LSTM song song trên cùng một chuỗi (một theo chiều thuận và một theo chiều ngược) rồi kết hợp cả hai trạng thái ẩn tại mỗi bước thời gian.[24] Nhờ vậy, mỗi đầu ra không chỉ phụ thuộc vào ngữ cảnh trước đó mà còn vào ngữ cảnh phía sau, đặc biệt hữu ích trong các tác vụ như nhận dạng giọng nói và gán nhãn chuỗi, nơi toàn bộ chuỗi đầu vào đã có sẵn trước khi đưa ra dự đoán.

LSTM xếp chồng (stacked LSTM) là hướng mở rộng thứ hai, trong đó nhiều lớp LSTM được xếp chồng lên nhau; đầu ra của lớp dưới trở thành đầu vào của lớp trên. Graves, Mohamed và Hinton đã chứng minh năm 2013 rằng kiến trúc này đạt tỉ lệ lỗi chỉ17,7% trên tập dữ liệu TIMIT, vượt trội hơn các phương pháp trước đó nhờ khả năng học các biểu diễn trừu tượng theo từng cấp độ.[25]

Ứng dụng

[sửa | sửa mã nguồn]

Dịch máy

[sửa | sửa mã nguồn]
Từ năm 2016, Google Dịch bắt đầu sử dụng kiến trúc LSTM với 8 lớp, mỗi lớp rộng 1024, và một mạng truyền thẳng đơn giản gồm 1 lớp rộng 1024 kết nối chúng. Mặc dù vậy, chúng đã bị kiến trúc transformer thay thế vào năm 2020.
Từ năm 2016, Google Dịch bắt đầu sử dụng kiến trúc LSTM với 8 lớp, mỗi lớp rộng 1024, và một mạng truyền thẳng đơn giản gồm 1 lớp rộng 1024 kết nối chúng.[7] Mặc dù vậy, chúng đã bị kiến trúc transformer thay thế vào năm 2020.[26]

LSTM đóng vai trò trung tâm trong sự chuyển dịch từ dịch máy thống kê sang dịch máy thần kinh (neural machine translation, NMT) trong thập niên 2010. Năm 2014, Cho và các cộng sự đề xuất kiến trúc mã hóa-giải mã (encoder-decoder) dựa trên RNN, trong đó một mạng LSTM mã hóa câu nguồn thành một vector ngữ cảnh cố định, rồi một mạng LSTM khác giải mã vector đó thành câu đích.[22] Cùng năm, Sutskever, Vinyals và Le chứng minh rằng kiến trúc tương tự với LSTM xếp chồng đạt kết quả cạnh tranh với các hệ thống dịch máy thống kê tốt nhất thời điểm đó trên cặp ngôn ngữ Anh-Pháp.[27]

Năm 2016, Google triển khai hệ thống Google Neural Machine Translation (GNMT) cho Google Dịch, sử dụng LSTM xếp chồng tám lớp với cơ chế chú ý (attention mechanism), giảm lỗi dịch xuống 60% so với hệ thống thống kê trước đó trên nhiều cặp ngôn ngữ.[7] Cũng trong năm 2016, Facebook chuyển toàn bộ hệ thống dịch thuật sang LSTM, xử lý khoảng 4,5 tỉ lượt dịch tự động mỗi ngày.[8]

Nhận dạng giọng nói và trợ lý ảo

[sửa | sửa mã nguồn]

Năm 2015, Google bắt đầu sử dụng LSTM được huấn luyện bằng CTC (connectionist temporal classification) cho Google Voice, giảm tỉ lệ lỗi phiên âm xuống 49% so với hệ thống GMM-HMM trước đó.[28] Năm 2016, Apple tích hợp LSTM vào Siri và tính năng QuickType trên iPhone để cải thiện nhận dạng giọng nói và dự đoán văn bản.[29][30] Cùng năm, Amazon phát hành Polly, hệ thống chuyển văn bản thành giọng nói của Alexa sử dụng BiLSTM để tạo ra giọng nói tự nhiên.[31] Năm 2016, Google cũng tích hợp LSTM vào ứng dụng nhắn tin Allo để gợi ý phản hồi thông minh.[32]

Nhận dạng chữ viết tay

[sửa | sửa mã nguồn]

Năm 2009, một hệ thống LSTM được huấn luyện bằng CTC do Alex Graves dẫn đầu giành chiến thắng tại cuộc thi nhận dạng chữ viết tay kết nối ICDAR, trở thành lần đầu tiên một mạng thần kinh hồi quy vô địch một cuộc thi quốc tế với một mô hình đạt độ chính xác cao nhất và một mô hình khác đạt tốc độ nhanh nhất.[33]

Dự báo và phân tích chuỗi thời gian

[sửa | sửa mã nguồn]

Ngoài ngôn ngữ tự nhiên, LSTM được ứng dụng rộng rãi trong các bài toán dự báo chuỗi thời gian nhờ khả năng nắm bắt các xu hướng dài hạn trong dữ liệu tuần tự. Trong dự báo tài chính, LSTM được dùng để dự đoán tỉ giá hối đoái và giá cổ phiếu trên thị trường chứng khoán.[34] Trong dự báo giao thông, LSTM được áp dụng để dự đoán lưu lượng xe ngắn hạn.[35] Trong lĩnh vực thủy văn, LSTM cho thấy khả năng mô phỏng mối quan hệ giữa lượng mưa và dòng chảy tốt hơn các mô hình vật lý truyền thống trên nhiều lưu vực sông.[36]

Khoa học và y tế

[sửa | sửa mã nguồn]

Trong sinh học tính toán, Hochreiter và các cộng sự ứng dụng LSTM vào phát hiện tương đồng protein (protein homology detection) năm 2007, cho thấy LSTM có thể phân loại các chuỗi protein mà không cần căn chỉnh chuỗi (sequence alignment) truyền thống.[37] Trong y tế, LSTM được dùng để dự đoán các sự kiện lâm sàng từ hồ sơ bệnh nhân điện tử, điển hình là hệ thống Doctor AI của Choi và các cộng sự năm 2016, có khả năng dự đoán chẩn đoán và thuốc điều trị trong tương lai dựa trên lịch sử khám chữa bệnh.[38]

Ảnh hưởng

[sửa | sửa mã nguồn]

LSTM là kiến trúc mạng thần kinh hồi quy thống trị trong hầu hết các tác vụ xử lý chuỗi suốt gần hai thập kỷ, từ dịch máy, nhận dạng giọng nói đến phân tích chuỗi thời gian. Tuy nhiên, từ năm 2017, kiến trúc Transformer do Vaswani và các cộng sự đề xuất dần thay thế LSTM trong các tác vụ ngôn ngữ tự nhiên nhờ cơ chế tự chú ý (self-attention) cho phép xử lý song song toàn bộ chuỗi thay vì tuần tự từng bước.[39] Năm 2020, Kaplan và các cộng sự tại OpenAI chứng minh qua thực nghiệm rằng Transformer tuân theo các quy luật tỉ lệ (scaling law) tốt hơn LSTM khi tăng quy mô dữ liệu và tham số trong mô hình hóa ngôn ngữ, củng cố thêm xu hướng chuyển dịch này.[40]

Dù vậy, LSTM vẫn giữ vai trò quan trọng trong nhiều lĩnh vực ngoài ngôn ngữ tự nhiên, đặc biệt là các bài toán chuỗi thời gian trong tài chính, thủy văn, y tế và giao thông – nơi dữ liệu thường có độ dài ngắn hơn và tính tuần tự chặt chẽ hơn so với văn bản, khiến lợi thế xử lý song song của Transformer ít có ý nghĩa thực tế hơn. Trong các bối cảnh này, LSTM tiếp tục cạnh tranh được với các kiến trúc hiện đại hơn nhờ hiệu quả tính toán và khả năng hoạt động tốt trên tập dữ liệu nhỏ.

Năm 2024, chính Sepp Hochreiter dẫn đầu một nhóm nghiên cứu tại Đại học Johannes Kepler công bố xLSTM (extended LSTM), nâng cấp kiến trúc LSTM gốc bằng cách bổ sung cơ chế cập nhật theo cấp số nhân và chuẩn hóa mới cho phép mở rộng quy mô tốt hơn.[41] xLSTM gồm hai khối: sLSTM giữ lại cơ chế trạng thái vô hướng của LSTM gốc cho phép theo dõi trạng thái (state tracking), và mLSTM thay thế trạng thái vô hướng bằng ma trận bộ nhớ có thể tính toán song song tương tự Transformer.[41]

Tham khảo

[sửa | sửa mã nguồn]
  1. 1 2 3 4 5 Hochreiter, Sepp; Schmidhuber, Jürgen (ngày 1 tháng 11 năm 1997). "Long Short-Term Memory". Neural Computation (bằng tiếng Anh). 9 (8): 1735–1780. doi:10.1162/neco.1997.9.8.1735. ISSN 0899-7667.
  2. ↑ Graves, Alex; Fernández, Santiago; Gomez, Faustino; Schmidhuber, Jürgen (2006). "Connectionist temporal classification: Labelling unsegmented sequence data with recurrent neural networks". In Proceedings of the International Conference on Machine Learning, ICML 2006: 369–376. CiteSeerX 10.1.1.75.6306.
  3. ↑ Karim, Fazle; Majumdar, Somshubra; Darabi, Houshang; Chen, Shun (2018). "LSTM Fully Convolutional Networks for Time Series Classification". IEEE Access. 6: 1662–1669. arXiv:1709.05206. Bibcode:2018IEEEA...6.1662K. doi:10.1109/ACCESS.2017.2779939. ISSN 2169-3536.
  4. ↑ Wierstra, Daan (ngày 1 tháng 1 năm 2005). "Evolino: Hybrid Neuroevolution/Optimal Linear Search for Sequence Learning". {{Chú thích tập san học thuật}}: Chú thích journal cần |journal= (trợ giúp)
  5. ↑ Sak, Hasim; Senior, Andrew; Beaufays, Francoise (2014). "Long Short-Term Memory recurrent neural network architectures for large scale acoustic modeling" (PDF). Bản gốc (PDF) lưu trữ ngày 24 tháng 4 năm 2018.
  6. ↑ Li, Xiangang; Wu, Xihong (ngày 15 tháng 10 năm 2014). "Constructing Long Short-Term Memory based Deep Recurrent Neural Networks for Large Vocabulary Speech Recognition". arXiv:1410.4281 [cs.CL].
  7. 1 2 3 Wu, Yonghui; Schuster, Mike; Chen, Zhifeng; Le, Quoc V.; Norouzi, Mohammad; Macherey, Wolfgang; Krikun, Maxim; Cao, Yuan; Gao, Qin (ngày 26 tháng 9 năm 2016). "Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation". arXiv:1609.08144 [cs.CL].
  8. 1 2 Ong, Thuy (ngày 4 tháng 8 năm 2017). "Facebook's translations are now powered completely by AI". www.allthingsdistributed.com. Truy cập ngày 15 tháng 2 năm 2019.
  9. ↑ Sahidullah, Md; Patino, Jose; Cornell, Samuele; Yin, Ruiking; Sivasankaran, Sunit; Bredin, Herve; Korshunov, Pavel; Brutti, Alessio; Serizel, Romain; Vincent, Emmanuel; Evans, Nicholas; Marcel, Sebastien; Squartini, Stefano; Barras, Claude (ngày 6 tháng 11 năm 2019). "The Speed Submission to DIHARD II: Contributions & Lessons Learned". arXiv:1911.02388 [eess.AS].
  10. ↑ Mayer, H.; Gomez, F.; Wierstra, D.; Nagy, I.; Knoll, A.; Schmidhuber, J. (tháng 10 năm 2006). "A System for Robotic Heart Surgery that Learns to Tie Knots Using Recurrent Neural Networks". 2006 IEEE/RSJ International Conference on Intelligent Robots and Systems. tr. 543–548. CiteSeerX 10.1.1.218.3399. doi:10.1109/IROS.2006.282190. ISBN 978-1-4244-0258-8. S2CID 12284900.
  11. ↑ "Learning Dexterity". OpenAI. ngày 30 tháng 7 năm 2018. Bản gốc lưu trữ ngày 2 tháng 7 năm 2023. Truy cập ngày 28 tháng 6 năm 2023.
  12. ↑ Rodriguez, Jesus (ngày 2 tháng 7 năm 2018). "The Science Behind OpenAI Five that just Produced One of the Greatest Breakthrough in the History of AI". Towards Data Science. Bản gốc lưu trữ ngày 26 tháng 12 năm 2019. Truy cập ngày 15 tháng 1 năm 2019.
  13. ↑ Stanford, Stacy (ngày 25 tháng 1 năm 2019). "DeepMind's AI, AlphaStar Showcases Significant Progress Towards AGI". Medium ML Memoirs. Truy cập ngày 15 tháng 1 năm 2019.
  14. ↑ Schmidhuber, Jürgen (2021). "The 2010s: Our Decade of Deep Learning / Outlook on the 2020s". AI Blog. IDSIA, Switzerland. Truy cập ngày 30 tháng 4 năm 2022.
  15. ↑ Maity, Abhishek; Tukarul, Viraj (ngày 23 tháng 1 năm 2026). "Forecasting Energy Consumption using Recurrent Neural Networks: A Comparative Analysis". arXiv:2601.17110 [cs.CY].
  16. ↑ Li, Jiajun; Liu, Lemao; Zhang, Guanhua; Zong, Chengqing (2022). "Progress in Machine Translation". Engineering. 18: 143–153. doi:10.1016/j.eng.2021.03.023.
  17. ↑ Hinton, Geoffrey; Deng, Li; Yu, Dong; Dahl, George E.; Mohamed, Abdel-rahman; Jaitly, Navdeep; Senior, Andrew; Vanhoucke, Vincent; Nguyen, Patrick; Sainath, Tara N.; Kingsbury, Brian (2012). "Deep Neural Networks for Acoustic Modeling in Speech Recognition: The Shared Views of Four Research Groups". IEEE Signal Processing Magazine. 29 (6): 82–97. doi:10.1109/MSP.2012.2205597.
  18. ↑ Hochreiter, Sepp (1991). Untersuchungen zu dynamischen neuronalen Netzen (PDF) (Luận văn). Technical University Munich, Institute of Computer Science.
  19. ↑ Bengio, Yoshua; Simard, Patrice; Frasconi, Paolo (1994). "Learning long-term dependencies with gradient descent is difficult". IEEE Transactions on Neural Networks. 5 (2): 157–166. doi:10.1109/72.279181.
  20. 1 2 Gers, Felix A.; Schmidhuber, Jürgen; Cummins, Fred (2000). "Learning to Forget: Continual Prediction with LSTM". Neural Computation. 12 (10): 2451–2471. doi:10.1162/089976600300015015.
  21. 1 2 3 Gers, F. A.; Schmidhuber, J. (2001). "LSTM Recurrent Networks Learn Simple Context Free and Context Sensitive Languages". IEEE Transactions on Neural Networks. 12 (6): 1333–1340. doi:10.1109/72.963769.
  22. 1 2 Cho, Kyunghyun; van Merrienboer, Bart; Gulcehre, Caglar; Bahdanau, Dzmitry; Bougares, Fethi; Schwenk, Holger; Bengio, Yoshua (2014). "Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation". arXiv:1406.1078 [cs.CL].
  23. ↑ Srivastava, Rupesh K.; Greff, Klaus; Schmidhuber, Juergen (2015). "Training Very Deep Networks". Advances in Neural Information Processing Systems. Quyển 28. doi:10.48550/arXiv.1507.06228.
  24. ↑ Graves, Alex; Schmidhuber, Jürgen (2005). "Framewise phoneme classification with bidirectional LSTM and other neural network architectures". Neural Networks. 18 (5–6): 602–610. doi:10.1016/j.neunet.2005.06.042.
  25. ↑ Graves, Alex; Mohamed, Abdel-rahman; Hinton, Geoffrey (2013). "Speech recognition with deep recurrent neural networks". 2013 IEEE International Conference on Acoustics, Speech and Signal Processing. tr. 6645–6649. doi:10.1109/ICASSP.2013.6638947.
  26. ↑ "Recent Advances in Google Translate". research.google (bằng tiếng Anh). Truy cập ngày 23 tháng 4 năm 2026.
  27. ↑ Sutskever, Ilya; Vinyals, Oriol; Le, Quoc V. (2014). "Sequence to Sequence Learning with Neural Networks". arXiv:1409.3215 [cs.CL].
  28. ↑ "Neon prescription... or rather, New transcription for Google Voice". Official Google Blog. ngày 23 tháng 7 năm 2015.
  29. ↑ Smith, Chris (ngày 13 tháng 6 năm 2016). "iOS 10: Siri now works in third-party apps, comes with extra AI features". BGR.
  30. ↑ Efrati, Amir (ngày 13 tháng 6 năm 2016). "Apple's Machines Can Learn Too". The Information.
  31. ↑ Vogels, Werner (ngày 30 tháng 11 năm 2016). "Bringing the Magic of Amazon AI and Alexa to Apps on AWS". All Things Distributed.
  32. ↑ Khaitan, Pranav (ngày 18 tháng 5 năm 2016). "Chat Smarter with Allo". Google Research Blog.
  33. ↑ Graves, Alex; Liwicki, Marcus; Fernández, Santiago; Bertolami, Roman; Bunke, Horst; Schmidhuber, Jürgen (2009). "A Novel Connectionist System for Unconstrained Handwriting Recognition". IEEE Transactions on Pattern Analysis and Machine Intelligence. 31 (5): 855–868. doi:10.1109/tpami.2008.137.
  34. ↑ Saiful Islam, Md.; Hossain, Emam (2020). "Foreign Exchange Currency Rate Prediction using a GRU-LSTM Hybrid Network". Soft Computing Letters. 3. doi:10.1016/j.socl.2020.100009.
  35. ↑ Zhao, Z.; Chen, W.; Wu, X.; Chen, P.C.Y.; Liu, J. (2017). "LSTM network: A deep learning approach for Short-term traffic forecast". IET Intelligent Transport Systems. 11 (2): 68–75. doi:10.1049/iet-its.2016.0208.
  36. ↑ Kratzert, Frederik; Klotz, Daniel; Shalev, Guy; Klambauer, Günter; Hochreiter, Sepp; Nearing, Grey (2019). "Towards learning universal, regional, and local hydrological behaviors via machine learning applied to large-sample datasets". Hydrology and Earth System Sciences. 23 (12): 5089–5110. doi:10.5194/hess-23-5089-2019.{{Chú thích tập san học thuật}}: Quản lý CS1: DOI truy cập mở nhưng không được đánh ký hiệu (liên kết)
  37. ↑ Hochreiter, Sepp; Heusel, Martin; Obermayer, Klaus (2007). "Fast model-based protein homology detection without alignment". Bioinformatics. 23 (14): 1728–1736. doi:10.1093/bioinformatics/btm247.
  38. ↑ Choi, Edward; Bahadori, Mohammad Taha; Schuetz, Elizabeth; Stewart, Walter; Sun, Jimeng (2016). "Doctor AI: Predicting Clinical Events via Recurrent Neural Networks". JMLR Workshop and Conference Proceedings. 56: 301–318. doi:10.48550/arXiv.1511.05942.
  39. ↑ Vaswani, Ashish; Shazeer, Noam; Parmar, Niki; Uszkoreit, Jakob; Jones, Llion; Gomez, Aidan N.; Kaiser, Łukasz; Polosukhin, Illia (2017). "Attention Is All You Need". arXiv:1706.03762 [cs.CL].
  40. ↑ Kaplan, Jared; McCandlish, Sam; Henighan, Tom; Brown, Tom B.; Chess, Benjamin; Child, Rewon; Gray, Scott; Radford, Alec; Wu, Jeffrey; Amodei, Dario (2020). "Scaling Laws for Neural Language Models". arXiv:2001.08361 [cs.LG].
  41. 1 2 Beck, Maximilian; Pöppel, Korbinian; Spanring, Markus; Auer, Andreas; Prudnikova, Oleksandra; Kopp, Michael; Klambauer, Günter; Brandstetter, Johannes; Hochreiter, Sepp (2024). "xLSTM: Extended Long Short-Term Memory". arXiv:2405.04517 [cs.LG].