embeded/jetson2026. 7. 21. 16:02

jetson nano 4GB 에서 시도함.

cuda는 버전에 낮아서 안되고(llama.cpp가 cuda 12/13 지원. 얘는 10.x)

docker에서는 nvidia vulkan이 없어서 가속을 할 수 없어서 native vulkan빌드 부터 개고생해서 올렸는데

노력대비(2일 풀로 가동..) 효율이 좋다고 할 순 없겠지만,

그래도 나름 괜찮은 성능과 vulkan 가속이라 cpu 점유율 낮출 수 있다는게 그나마 위안인가..

그런데 이러면 발열은 어떨려나? cpu쪽이 더 낮을까.. gpu  쓰는게 낮을까?

 

옆에 스크롤이 점만해졌음 ㅋㅋㅋ 중반쯤에 포기하자는거 끝까지 멱살잡고 캐리해서 진행해버림 

ㅋㅋ 이러니 ai가 반란을 일으키고 터미네이터가 되는건가 ㅋㅋ

2GB 메모리라면 최소한 스왑 6GB 이상은 해야 할 것으로 보인다.

sudo fallocate -l 4G /swapfile
sudo chmod 600 /swapfile
sudo mkswap /swapfile
sudo swapon /swapfile

 

일단 gcc9를 설치하면 손쉽게 행복해짐

sudo apt-get install -y software-properties-common
sudo add-apt-repository -y ppa:ubuntu-toolchain-r/test
sudo apt-get update
sudo apt-get install -y gcc-9 g++-9

 

빌드를 위한 헤더들 및 버전 맞추기

dpkg -l | grep nvidia-l4t
sudo apt-get update
sudo apt-get install --only-upgrade -y \
  nvidia-l4t-core \
  nvidia-l4t-bootloader \
  nvidia-l4t-configs \
  nvidia-l4t-gputools \
  nvidia-l4t-initrd \
  nvidia-l4t-jetson-io \
  nvidia-l4t-oem-config \
  nvidia-l4t-tools
sudo ldconfig
vulkaninfo --summary   # 여기서 GPU(NVIDIA Tegra X1 (nvgpu))가 정상 인식되는지 확인

sudo apt-get install -y libvulkan-dev libvulkan1
sudo apt-get install -y nvidia-l4t-libvulkan

 

glslang 설치

cd ~
git clone https://github.com/KhronosGroup/glslang.git
cd glslang
python3 update_glslang_sources.py
mkdir build && cd build
export LDFLAGS="-lstdc++fs"
/opt/cmake/bin/cmake .. -DCMAKE_BUILD_TYPE=Release -DCMAKE_INSTALL_PREFIX=/usr/local \
  -DCMAKE_C_COMPILER=gcc-9 -DCMAKE_CXX_COMPILER=g++-9
make -j$(nproc)
sudo make install
which glslangValidator

 

 shaderc 설치

cd ~
git clone https://github.com/google/shaderc.git
cd shaderc
python3 utils/git-sync-deps
mkdir build && cd build
export LDFLAGS="-lstdc++fs"
/opt/cmake/bin/cmake .. -DCMAKE_BUILD_TYPE=Release -DCMAKE_INSTALL_PREFIX=/usr/local \
  -DCMAKE_C_COMPILER=gcc-9 -DCMAKE_CXX_COMPILER=g++-9 \
  -DSHADERC_SKIP_TESTS=ON -DSHADERC_SKIP_EXAMPLES=ON \
  -DSPIRV_SKIP_EXECUTABLES=ON
make glslc_exe -j$(nproc)
sudo cp glslc/glslc /usr/local/bin/
which glslc
glslc --version

 

vulkan 관련 헤더 SPIRV 설치

cd ~
git clone https://github.com/KhronosGroup/SPIRV-Headers.git
cd SPIRV-Headers
mkdir build && cd build
/opt/cmake/bin/cmake .. -DCMAKE_INSTALL_PREFIX=/usr/local
sudo make install

 

cmake version 3.31.8 설치

/opt/cmake/bin/cmake .. -DGGML_VULKAN=ON   -DCMAKE_C_COMPILER=gcc-9 -DCMAKE_CXX_COMPILER=g++-9   -DCMAKE_C_FLAGS="-Wno-error"

 

아래는 빌드시 문제가 되서 수정한 부분

$ git status
On branch master
Your branch is up to date with 'origin/master'.

Changes not staged for commit:
  (use "git add <file>..." to update what will be committed)
  (use "git checkout -- <file>..." to discard changes in working directory)

modified:   ../../ggml/src/ggml-cpu/ggml-cpu-impl.h
modified:   ../../tools/ui/CMakeLists.txt

no changes added to commit (use "git add" and/or "git commit -a")
jetson@jetson-desktop:~/src/llama.cpp/build/bin$ git diff
diff --git a/ggml/src/ggml-cpu/ggml-cpu-impl.h b/ggml/src/ggml-cpu/ggml-cpu-impl.h
index 5d1ca5ffc..f39d56694 100644
--- a/ggml/src/ggml-cpu/ggml-cpu-impl.h
+++ b/ggml/src/ggml-cpu/ggml-cpu-impl.h
@@ -296,12 +296,28 @@ inline static uint8x16_t ggml_vqtbl1q_u8(uint8x16_t a, uint8x16_t b) {
 
 #define ggml_vld1q_s16_x2 vld1q_s16_x2
 #define ggml_vld1q_u8_x2  vld1q_u8_x2
-#define ggml_vld1q_u8_x4  vld1q_u8_x4
 #define ggml_vld1q_s8_x2  vld1q_s8_x2
-#define ggml_vld1q_s8_x4  vld1q_s8_x4
 #define ggml_vqtbl1q_s8   vqtbl1q_s8
 #define ggml_vqtbl1q_u8   vqtbl1q_u8
 
+inline static uint8x16x4_t ggml_vld1q_u8_x4(const uint8_t * ptr) {
+    uint8x16x4_t res;
+    res.val[0] = vld1q_u8(ptr + 0);
+    res.val[1] = vld1q_u8(ptr + 16);
+    res.val[2] = vld1q_u8(ptr + 32);
+    res.val[3] = vld1q_u8(ptr + 48);
+    return res;
+}
+
+inline static int8x16x4_t ggml_vld1q_s8_x4(const int8_t * ptr) {
+    int8x16x4_t res;
+    res.val[0] = vld1q_s8(ptr + 0);
+    res.val[1] = vld1q_s8(ptr + 16);
+    res.val[2] = vld1q_s8(ptr + 32);
+    res.val[3] = vld1q_s8(ptr + 48);
+    return res;
+}
+
 #endif // !defined(__aarch64__)
 
 #if !defined(__ARM_FEATURE_DOTPROD)
diff --git a/tools/ui/CMakeLists.txt b/tools/ui/CMakeLists.txt
index 74bca417e..488fdc0be 100644
--- a/tools/ui/CMakeLists.txt
+++ b/tools/ui/CMakeLists.txt
@@ -105,3 +105,5 @@ endif()
 target_include_directories(${TARGET} PUBLIC
     ${CMAKE_CURRENT_BINARY_DIR}
 )
+
+target_link_libraries(llama-ui-embed PRIVATE stdc++fs)

 

git log. 일단 현시점 최신 버전인 b10068, 2026년 7월 18일자 소스

commit 571d0d540df04f25298d0e159e520d9fc62ed121 (HEAD -> master, tag: b10068, origin/master, origin/HEAD)
Author: Ruixiang Wang <wangruixiang07@outlook.com>
Date:   Sat Jul 18 15:02:18 2026 +0200

 

클로드 만세!!! string 머시기 없다고 파이썬으로 해치워 버림

cd ~/src/llama.cpp
python3 << 'PYEOF'
path = "ggml/src/ggml-cpu/ggml-cpu-impl.h"
with open(path, "r") as f:
    content = f.read()

old = """#define ggml_vld1q_s16_x2 vld1q_s16_x2
#define ggml_vld1q_u8_x2  vld1q_u8_x2
#define ggml_vld1q_u8_x4  vld1q_u8_x4
#define ggml_vld1q_s8_x2  vld1q_s8_x2
#define ggml_vld1q_s8_x4  vld1q_s8_x4
#define ggml_vqtbl1q_s8   vqtbl1q_s8
#define ggml_vqtbl1q_u8   vqtbl1q_u8"""

new = """#define ggml_vld1q_s16_x2 vld1q_s16_x2
#define ggml_vld1q_u8_x2  vld1q_u8_x2
#define ggml_vld1q_s8_x2  vld1q_s8_x2
#define ggml_vqtbl1q_s8   vqtbl1q_s8
#define ggml_vqtbl1q_u8   vqtbl1q_u8

inline static uint8x16x4_t ggml_vld1q_u8_x4(const uint8_t * ptr) {
    uint8x16x4_t res;
    res.val[0] = vld1q_u8(ptr + 0);
    res.val[1] = vld1q_u8(ptr + 16);
    res.val[2] = vld1q_u8(ptr + 32);
    res.val[3] = vld1q_u8(ptr + 48);
    return res;
}

inline static int8x16x4_t ggml_vld1q_s8_x4(const int8_t * ptr) {
    int8x16x4_t res;
    res.val[0] = vld1q_s8(ptr + 0);
    res.val[1] = vld1q_s8(ptr + 16);
    res.val[2] = vld1q_s8(ptr + 32);
    res.val[3] = vld1q_s8(ptr + 48);
    return res;
}"""

assert old in content, "패턴을 못 찾음 - 파일 확인 필요"
content = content.replace(old, new)
with open(path, "w") as f:
    f.write(content)
print("패치 완료")
PYEOF

 

llama.cpp vulkan 활성화 해서 빌드.

-j4 하고 싶은데 두번 정도 메모리 엄청 먹으면서 하나 빌드하는게 있어서 늦더라도 -j1 추천

cd ~/src/llama.cpp
mkdir -p build && cd build
rm -rf *
export LDFLAGS="-lstdc++fs"
/opt/cmake/bin/cmake .. -DGGML_VULKAN=ON \
  -DCMAKE_C_COMPILER=gcc-9 -DCMAKE_CXX_COMPILER=g++-9 \
  -DCMAKE_C_FLAGS="-Wno-error"

make llama-cli llama-server -j1

 

그렇게 빌드된 녀석을 qwen3.5-0.8B-Q4 돌리면!

$ ./llama-cli -m ~/llm/Qwen3.5-0.8B-Q4_0.gguf --chat-template-kwargs "{\"enable_thinking\": false}" -c 4096 -ngl 99 -fa on


Loading model...  

▄▄ ▄▄
██ ██
██ ██  ▀▀█▄ ███▄███▄  ▀▀█▄    ▄████ ████▄ ████▄
██ ██ ▄█▀██ ██ ██ ██ ▄█▀██    ██    ██ ██ ██ ██
██ ██ ▀█▄██ ██ ██ ██ ▀█▄██ ██ ▀████ ████▀ ████▀
                                    ██    ██
                                    ▀▀    ▀▀

build      : b10068-571d0d540
model      : /home/jetson/llm/Qwen3.5-0.8B-Q4_0.gguf
ftype      : Q4_0
modalities : text

available commands:
  /exit or Ctrl+C     stop or exit
  /regen              regenerate the last response
  /clear              clear the chat history
  /read <file>        add a text file
  /glob <pattern>     add text files using globbing pattern



> 안녕?
안녕하세요! 어시, 어떻게 도와드릴 수 있을까요?

[ Prompt: 21.4 t/s | Generation: 9.1 t/s ]

> 안녕?
안녕하세요! 어시, 어떻게 도와드릴 수 있을까요?

[ Prompt: 23.0 t/s | Generation: 9.1 t/s ]

> 너에 대해 소개
안녕하세요! 저는 인공지능(AI) 기술의 능력을 활용하여 정보를 제공하거나 논리적 사고를 도와줄 수 있는 **공급 서비스 봇 (Assistant)**입니다.

나는 다음과 같은 역할을 수행할 수 있습니다:
*   **정보 제공**: 지식 기반의 정보를 검색하고 요약 또는 정리해 줄 수 있습니다.
*   **논리적 분석**: 문장 구조나 논리 논리를 분석하여 설명을 돕습니다.
*   **문제 해결**: 질문에 답하거나 상황을 분석할 수 있습니다.
*   **대화 및 학습**: 대화와 학습을 통해 사용자 경험을 개선해 줍니다.

이러한 기능을 통해 **AI**를 대신할 수 있는 인간과 유사한 능력으로 **사용자**에게 도움을 줄 수 있습니다.

어떤 내용을 원하시는가요? (예: 답변, 설명, 대화, 학습 자료 등)

[ Prompt: 21.8 t/s | Generation: 8.5 t/s ]

> 코드 작성 python hello world 출력
네, 안녕하세요! 저는 인공지능(AI) 기술의 능력을 활용하여 정보를 제공하거나 논리적 사고를 도와드릴 수 있는 서비스 봇입니다.

제대안은 **Python**을 사용하여 `print` 함수로 `hello world`를 출력하는 코드를 작성해 드립니다.

```python
print("hello world")
```

이 코드를 실행하면 다음 문장이 출력됩니다:
`hello world`

혹시 다른 언어 (예: JavaScript, Java 등) 의 `hello world` 예제를 작성하고 싶으시다면 말씀해 주세요!

[ Prompt: 37.1 t/s | Generation: 8.4 t/s ]

 

jtop 에서 GPU 잘 올라간다. ㅋㅋㅋ

메모리는 1.2G / 3.9G. 잘하면 2G 모델에서도 돌아가겠는데?

 

요건 사용하지 않을때 GPU 정보. 76.8MHz 까지 떨어지다니 ㄷㄷ

 

혹시나 몰라서 동일 조건에서 gpu 사용하지 않도록 ngl 0 으로 하고 테스트

$ ./llama-cli -m ~/llm/Qwen3.5-0.8B-Q4_0.gguf --chat-template-kwargs "{\"enable_thinking\": false}" -c 4096 -ngl 0 -fa on


Loading model...  

▄▄ ▄▄
██ ██
██ ██  ▀▀█▄ ███▄███▄  ▀▀█▄    ▄████ ████▄ ████▄
██ ██ ▄█▀██ ██ ██ ██ ▄█▀██    ██    ██ ██ ██ ██
██ ██ ▀█▄██ ██ ██ ██ ▀█▄██ ██ ▀████ ████▀ ████▀
                                    ██    ██
                                    ▀▀    ▀▀

build      : b10068-571d0d540
model      : /home/jetson/llm/Qwen3.5-0.8B-Q4_0.gguf
ftype      : Q4_0
modalities : text

available commands:
  /exit or Ctrl+C     stop or exit
  /regen              regenerate the last response
  /clear              clear the chat history
  /read <file>        add a text file
  /glob <pattern>     add text files using globbing pattern



> 안녕?
안녕하세요! 네, 알겠습니다. 저는 인공지능으로 대화하고 정보를 제공해 드릴 수 있는 도구입니다. 무엇을 도와드릴까요? 😊

[ Prompt: 5.9 t/s | Generation: 3.3 t/s ]

> 너에 대해 소개해줘
안녕하세요! 네, 알겠습니다. 저는 인공지능으로 대화하고 정보를 제공해 드릴 수 있는 도구입니다. 무엇을 도와드릴까요? 😊

[ Prompt: 9.2 t/s | Generation: 3.3 t/s ]

> 파이썬으로 현재 디렉토리 목록 보는 프로그램 작서앻줘ㅏ
프라이썬으로 현재 디렉토리 목록을 보고 싶으신가요? 😊

이제 바로 `dir` 명령어에 대한 설명부터 실행 방법까지 알려드릴게요.

### 📂 디렉토리 목록을 표시하는 명령어

프라이썬에서 파일이나 디렉토리를 표시하려면 먼저 `dir` 명령어를 사용합니다.

```bash
cd <디렉토리명>
```

예를 들어, `C:\Users\박\Documents`를 표시하려면:
```bash
cd C:\Users\박\Documents
```
**단순히 `dir`을 입력하면 현재 디렉토리를 표시할 수 있습니다.**

---

### 🛠️ 실행 방법

#### 1. **프라이썬을 실행하기**
프라이썬은 웹 브라우저로 작동하는 프로그램으로, 브라우저에서 직접 실행해 볼 수 있습니다.

**단순 브라우저에서 실행하기:**
*   **Chrome/Edge/ChromeOS:** `https://www.python.org/` 에서 `dir` 명령어 추가하기 (F12 또는 `F11`를 누ار)
*   **Mac OS:** `Finder` → `Extensions` → `File Explorer` → `Python` → `dir`

**프라이썬을 설치하기:**
1.  `https://www.python.org/` 에서 `Install Python` 클릭
2.  설치 후 `~` 경로에 추가되면, 브라우저에서 `file://` 주소창을 입력하고 입력한 URL 을 보시면 됩니다.

---

### 💻 기본 실행 예시

```python
# 위 설명에서 예시처럼, 현재 디렉토리를 확인
dir
```

혹시 특정 파일이나 디렉토리를 찾으셨다면 `dir` 대신 `find` 명령어도 사용할 수 있습니다.
```bash
find <디렉토리명> -name "파일명"
```

어떤 작업을 하되든 프라이썬이 도와드릴게요! 😊

[ Prompt: 10.0 t/s | Generation: 3.1 t/s ]

어.. 그래도 2.7배. 약간 과장하면 3배 상승이네?

'embeded > jetson' 카테고리의 다른 글

jetson nano jtop  (0) 2026.07.20
jetson nano 4GB / qwen3.5 0.8B  (0) 2026.07.20
jetson nano 과 llama.cpp (가속, 빌드 포기)  (0) 2026.07.20
jetson nano devloper kit SD card image(A02)  (0) 2026.07.20
jetracer donkey car  (0) 2026.04.20
Posted by 구차니
하드웨어/RAID2026. 7. 21. 11:47

poseidon os 는 sw로 구현된거라 느린 건 어쩔수 없는 거라는데

[링크 : https://spdk.io/]

[링크 : https://github.com/poseidonos/poseidonos] 23년 3월 커밋이 마지막. poseidonos.io는 도메인 날아간듯.

 

nvidia gpu로 asic을 대체하고 raid 구현한거.

single device보다 더 높게 나오는건 도대체 무슨 마법이냐

[링크 : https://tech.gluesys.com/blog/2022/10/28/GRAID_and_NVMe.html]

'하드웨어 > RAID' 카테고리의 다른 글

raid - predicted fail count  (0) 2024.04.22
MSM 디스크 제거시엔 stop!  (0) 2024.04.19
raid drive roaming  (0) 2024.04.18
SSD cahcecade 포기  (0) 2024.04.18
MSM device id?  (0) 2024.04.17
Posted by 구차니
embeded/jetson2026. 7. 20. 15:24

jetson nano 에는 nvidia-smi가 없어서 비슷한거 찾는데

gpt님께서 jtop을 점지해주심

 

sudo apt install python3-pip
sudo -H pip3 install -U jetson-stats
sudo systemctl restart jtop.service
jtop

 

cuda 예제 빌드해서 갈구니까

 

GPU에 올라가긴 한다

 

+

 

 

 

'embeded > jetson' 카테고리의 다른 글

jetson nano + llama.cpp vulkan  (0) 2026.07.21
jetson nano 4GB / qwen3.5 0.8B  (0) 2026.07.20
jetson nano 과 llama.cpp (가속, 빌드 포기)  (0) 2026.07.20
jetson nano devloper kit SD card image(A02)  (0) 2026.07.20
jetracer donkey car  (0) 2026.04.20
Posted by 구차니
embeded/jetson2026. 7. 20. 14:29

콘솔로 하니 이상하게 종료시 엔터가 미친듯이 나와서 웹으로 시도.

 

vulkan 인데도 vulkan 가속을 못 받는지 cpu 100%로 돈다.

 

최대 성능으로 가동

$ sudo nvpmodel -q
NVPM WARN: fan mode is not set!
NV Power Mode: MAXN
0

 

docker 로 서비스 실행

$ sudo docker run -p 8080:8080 -v /home/jetson/llm:/models ghcr.io/ggml-org/llama.cpp:server-vulkan --chat-template-kwargs "{\"enable_thinking\": false}"  -m /models/Qwen3.5-0.8B-Q4_0.gguf -c 4096 --port 8080 --host 0.0.0.0 
warn: LLAMA_ARG_HOST environment variable is set, but will be overwritten by command line argument --host
0.00.136.037 W Setting 'enable_thinking' via --chat-template-kwargs is deprecated. Use --reasoning on / --reasoning off instead.
0.00.136.924 I cmn  common_param: common_params_print_info: verbosity = 3 (adjust with the `-lv N` CLI arg)
0.00.138.536 W srv  llama_server: -----------------
0.00.138.551 W srv  llama_server: CORS is set to allow all origins ('*') and no API key is set
0.00.138.552 W srv  llama_server: this can be a security risk (cross-origin attacks)
0.00.138.553 W srv  llama_server: more info: https://github.com/ggml-org/llama.cpp/pull/25655
0.00.138.554 W srv  llama_server: -----------------
0.00.139.997 I srv    load_model: loading model '/models/Qwen3.5-0.8B-Q4_0.gguf'
0.04.582.967 I srv    load_model: initializing, n_slots = 4, n_ctx_slot = 4096, kv_unified = 'true'
0.04.681.224 I srv  llama_server: model loaded
0.04.681.254 I srv  llama_server: listening on http://0.0.0.0:8080
0.19.911.095 I slot get_availabl: id  3 | task -1 | selected slot by LRU, t_last = -1
0.19.911.286 I slot launch_slot_: id  3 | task 0 | processing task, is_child = 0
0.22.612.244 I slot print_timing: id  3 | task 0 | prompt eval time =    1093.85 ms /    13 tokens (   84.14 ms per token,    11.88 tokens per second)
0.22.612.263 I slot print_timing: id  3 | task 0 |        eval time =    1606.96 ms /    12 tokens (  133.91 ms per token,     7.47 tokens per second)
0.22.612.266 I slot print_timing: id  3 | task 0 |       total time =    2700.81 ms /    25 tokens
0.22.612.276 I slot print_timing: id  3 | task 0 |    graphs reused =         11
0.22.612.345 I slot      release: id  3 | task 0 | stop processing: n_tokens = 24, truncated = 0
0.32.329.433 I slot get_availabl: id  3 | task -1 | selected slot by LCP similarity, sim_best = 0.243 (> 0.100 thold), f_keep = 0.375
0.32.406.612 I slot launch_slot_: id  3 | task 14 | processing task, is_child = 0
0.37.382.135 I slot print_timing: id  3 | task 14 | prompt eval time =    2254.95 ms /    28 tokens (   80.53 ms per token,    12.42 tokens per second)
0.37.382.154 I slot print_timing: id  3 | task 14 |        eval time =    2720.41 ms /    18 tokens (  151.13 ms per token,     6.62 tokens per second)
0.37.382.157 I slot print_timing: id  3 | task 14 |       total time =    4975.37 ms /    46 tokens
0.37.382.160 I slot print_timing: id  3 | task 14 |    graphs reused =         27
0.37.382.205 I slot      release: id  3 | task 14 | stop processing: n_tokens = 54, truncated = 0
0.52.606.713 I slot get_availabl: id  3 | task -1 | selected slot by LCP similarity, sim_best = 0.471 (> 0.100 thold), f_keep = 0.611
0.52.606.847 I slot launch_slot_: id  3 | task 35 | processing task, is_child = 0
1.10.385.311 I slot print_timing: id  3 | task 35 | n_decoded =    100, tg =   6.70 t/s, tg_3s =   6.70 t/s
1.11.031.932 I slot print_timing: id  3 | task 35 | prompt eval time =    2847.89 ms /    37 tokens (   76.97 ms per token,    12.99 tokens per second)
1.11.031.951 I slot print_timing: id  3 | task 35 |        eval time =   15577.07 ms /   104 tokens (  149.78 ms per token,     6.68 tokens per second)
1.11.031.954 I slot print_timing: id  3 | task 35 |       total time =   18424.96 ms /   141 tokens
1.11.031.960 I slot print_timing: id  3 | task 35 |    graphs reused =        129
1.11.032.011 I slot      release: id  3 | task 35 | stop processing: n_tokens = 173, truncated = 0
3.50.029.790 I slot get_availabl: id  3 | task -1 | selected slot by LCP similarity, sim_best = 0.333 (> 0.100 thold), f_keep = 0.382
3.50.175.603 I slot launch_slot_: id  3 | task 142 | processing task, is_child = 0
3.57.905.059 I slot print_timing: id  3 | task 142 | prompt processing, n_tokens =    105, progress = 0.86, t =   7.73 s / 13.58 tokens per second
3.59.618.519 I slot print_timing: id  3 | task 142 | prompt processing, n_tokens =    128, progress = 0.98, t =   9.44 s / 13.56 tokens per second
4.10.877.834 I slot print_timing: id  3 | task 142 | prompt eval time =    9819.15 ms /   132 tokens (   74.39 ms per token,    13.44 tokens per second)
4.10.877.855 I slot print_timing: id  3 | task 142 |        eval time =   10882.92 ms /    72 tokens (  151.15 ms per token,     6.62 tokens per second)
4.10.877.858 I slot print_timing: id  3 | task 142 |       total time =   20702.07 ms /   204 tokens
4.10.877.862 I slot print_timing: id  3 | task 142 |    graphs reused =        198
4.10.877.944 I slot      release: id  3 | task 142 | stop processing: n_tokens = 269, truncated = 0

 

cpu  에서 10 token/sec 미만으로 나온다.

msec token token/sec
2700.81 (안녕) 25 9.25648231456489
4975.37 (안녕) 46 9.24554354751506
18424.96 (너에 대해 소개) 141 7.65266247525096
20702.07 (golang으로 hello world) 204 9.85408705506261

 

'embeded > jetson' 카테고리의 다른 글

jetson nano + llama.cpp vulkan  (0) 2026.07.21
jetson nano jtop  (0) 2026.07.20
jetson nano 과 llama.cpp (가속, 빌드 포기)  (0) 2026.07.20
jetson nano devloper kit SD card image(A02)  (0) 2026.07.20
jetracer donkey car  (0) 2026.04.20
Posted by 구차니
embeded/jetson2026. 7. 20. 14:08

by claude

Jetson Nano 사양
Compute Capability: 5.3

Jetson Nano는 Maxwell 아키텍처 기반 GPU(128 CUDA 코어)를 사용하며, compute capability는 5.3입니다.

CUDA 버전

Jetson Nano는 JetPack 버전에 따라 CUDA 버전이 결정됩니다.
Nano에서 지원되는 마지막(최신) JetPack은 JetPack 4.6.x 계열이며, 이때 CUDA 10.2가 탑재됩니다.
참고로 Jetson Nano는 32비트 시절부터 나온 구형 라인업(2019년 출시)이라 JetPack 5.x(CUDA 11.x 이상)는 지원하지 않습니다. JetPack 5 이상은 Xavier, Orin 계열부터 지원됩니다

 

netson nano / maxwell 기반 128 cuda core

GPU NVIDIA Maxwell architecture with 128 NVIDIA CUDA® cores
CPU Quad-core ARM Cortex-A57 MPCore processor
Memory 4 GB 64-bit LPDDR4, 1600MHz 25.6 GB/s

[링크 : https://developer.nvidia.com/embedded/jetson-nano]

 

맥스웰 compute capability - 5.x

all compute-capability 3.x (Kepler) devices but are not supported on compute-capability 5.x (Maxwell) 

[링크 : https://docs.nvidia.com/cuda/maxwell-compatibility-guide/]

 

cuda 10.2

$ cat /etc/nv_tegra_release
# R32 (release), REVISION: 7.1, GCID: 29818004, BOARD: t210ref, EABI: aarch64, DATE: Sat Feb 19 17:05:08 UTC 2022

$ nvcc --version
nvcc: NVIDIA (R) Cuda compiler driver
Copyright (c) 2005-2021 NVIDIA Corporation
Built on Sun_Feb_28_22:34:44_PST_2021
Cuda compilation tools, release 10.2, V10.2.300
Build cuda_10.2_r440.TC440_70.29663091_0

 

b10068 인데 cuda 12 와 cuda 13에 대해서 지원한다.

소스에서 빌드한다고 해서 될 게 아닌듯..

Windows:

Windows x64 (CPU)
Windows arm64 (CPU)
Windows arm64 (OpenCL Adreno)
Windows x64 (CUDA 12) - CUDA 12.4 DLLs
Windows x64 (CUDA 13) - CUDA 13.3 DLLs
Windows x64 (Vulkan)
Windows x64 (OpenVINO)
Windows x64 (SYCL)
Windows x64 (HIP)

[링크 : https://github.com/ggml-org/llama.cpp/releases]

 

+

이건 컴파일러 버전이 낮아서라고.. 에라이

[  5%] Building CXX object tools/ui/CMakeFiles/llama-ui-embed.dir/embed.cpp.o
/home/jetson/src/llama.cpp/tools/ui/embed.cpp:17:10: fatal error: filesystem: No such file or directory
 #include <filesystem>
          ^~~~~~~~~~~~
compilation terminated.

 

filesystem은 c+17에 도입되었고 8.x 부터 지원.

[링크 : https://jtrimind.github.io/troubleshooting/filesystem/]

 

$ g++ --version
g++ (Ubuntu/Linaro 7.5.0-3ubuntu1~18.04) 7.5.0
Copyright (C) 2017 Free Software Foundation, Inc.
This is free software; see the source for copying conditions.  There is NO
warranty; not even for MERCHANTABILITY or FITNESS FOR A PARTICULAR PURPOSE.

$ sudo apt install gcc-8 g++-8

$ sudo update-alternatives --install /usr/bin/gcc gcc /usr/bin/gcc-8 800 --slave /usr/bin/g++ g++ /usr/bin/g++-8
update-alternatives: using /usr/bin/gcc-8 to provide /usr/bin/gcc (gcc) in auto mode

$ g++ --version
g++ (Ubuntu/Linaro 8.4.0-1ubuntu1~18.04) 8.4.0
Copyright (C) 2018 Free Software Foundation, Inc.
This is free software; see the source for copying conditions.  There is NO
warranty; not even for MERCHANTABILITY or FITNESS FOR A PARTICULAR PURPOSE.

 

cmake 깔고 이상한짓 해도 안되서 포기. vulkan도 잘 안되는 것 같고 머지..?

sudo apt-get install libssl-dev libssl1.1
/opt/cmake/bin/cmake -B build -DLLAMA_BUILD_SERVER=ON -DLLAMA_BUILD_TOOLS=OFF -DLLAMA_BUILD_UI=OFF
/opt/cmake/bin/cmake --build build -j4

 

sharerc 빌드하고 하려니 이 난리. 에라이

/home/jetson/src/shaderc/third_party/abseil_cpp/absl/base/policy_checks.h:59:2: error: #error "This package requires GCC 10 or higher."
 #error "This package requires GCC 10 or higher."

'embeded > jetson' 카테고리의 다른 글

jetson nano jtop  (0) 2026.07.20
jetson nano 4GB / qwen3.5 0.8B  (0) 2026.07.20
jetson nano devloper kit SD card image(A02)  (0) 2026.07.20
jetracer donkey car  (0) 2026.04.20
jetson nano nvcc 빌드  (0) 2026.04.06
Posted by 구차니
embeded/jetson2026. 7. 20. 11:54

jetpack 이 4.5.1 vs 4.6.1 이라서

많은건 안바라고(!) 용량만 좀 넉넉하면 좋겠네

 

[링크 : https://developer.nvidia.com/embedded/downloads]

 

이건 이전에 구워놨던 jetracer 용으로 만들어진 이미지

[링크 : https://github.com/NVIDIA-AI-IOT/jetracer/blob/master/docs/software_setup.md]

'embeded > jetson' 카테고리의 다른 글

jetson nano 4GB / qwen3.5 0.8B  (0) 2026.07.20
jetson nano 과 llama.cpp (가속, 빌드 포기)  (0) 2026.07.20
jetracer donkey car  (0) 2026.04.20
jetson nano nvcc 빌드  (0) 2026.04.06
jetson nvcc 실행하기  (0) 2026.04.06
Posted by 구차니

일일이 다 뒤졌는데, b8599 부터 지원하는 듯.

물론 jetson nano 에서는 glic 버전 이슈로 돌아는 안간다. -_ㅠ

$ ./llama-b8599/llama-cli
./llama-b8599/llama-cli: /lib/aarch64-linux-gnu/libm.so.6: version `GLIBC_2.38' not found (required by ./llama-b8599/llama-cli)
./llama-b8599/llama-cli: /lib/aarch64-linux-gnu/libm.so.6: version `GLIBC_2.29' not found (required by ./llama-b8599/llama-cli)
./llama-b8599/llama-cli: /usr/lib/aarch64-linux-gnu/libssl.so.3: version `OPENSSL_3.0.0' not found (required by ./llama-b8599/llama-cli)
./llama-b8599/llama-cli: /usr/lib/aarch64-linux-gnu/libcrypto.so.3: version `OPENSSL_3.0.0' not found (required by ./llama-b8599/llama-cli)
./llama-b8599/llama-cli: /usr/lib/aarch64-linux-gnu/libstdc++.so.6: version `GLIBCXX_3.4.32' not found (required by ./llama-b8599/llama-cli)
./llama-b8599/llama-cli: /usr/lib/aarch64-linux-gnu/libstdc++.so.6: version `GLIBCXX_3.4.30' not found (required by ./llama-b8599/llama-cli)
./llama-b8599/llama-cli: /usr/lib/aarch64-linux-gnu/libstdc++.so.6: version `CXXABI_1.3.15' not found (required by ./llama-b8599/llama-cli)
./llama-b8599/llama-cli: /usr/lib/aarch64-linux-gnu/libstdc++.so.6: version `GLIBCXX_3.4.29' not found (required by ./llama-b8599/llama-cli)
./llama-b8599/llama-cli: /usr/lib/aarch64-linux-gnu/libstdc++.so.6: version `CXXABI_1.3.13' not found (required by ./llama-b8599/llama-cli)
./llama-b8599/llama-cli: /usr/lib/aarch64-linux-gnu/libstdc++.so.6: version `GLIBCXX_3.4.26' not found (required by ./llama-b8599/llama-cli)
./llama-b8599/llama-cli: /lib/aarch64-linux-gnu/libc.so.6: version `GLIBC_2.32' not found (required by ./llama-b8599/llama-cli)
./llama-b8599/llama-cli: /lib/aarch64-linux-gnu/libc.so.6: version `GLIBC_2.34' not found (required by ./llama-b8599/llama-cli)
./llama-b8599/llama-cli: /lib/aarch64-linux-gnu/libc.so.6: version `GLIBC_2.33' not found (required by ./llama-b8599/llama-cli)
./llama-b8599/llama-cli: /lib/aarch64-linux-gnu/libc.so.6: version `GLIBC_2.38' not found (required by ./llama-b8599/llama-cli)
./llama-b8599/llama-cli: /lib/aarch64-linux-gnu/libm.so.6: version `GLIBC_2.29' not found (required by /home/jetson/llm/llama-b8599/libmtmd.so.0)
./llama-b8599/llama-cli: /lib/aarch64-linux-gnu/libc.so.6: version `GLIBC_2.38' not found (required by /home/jetson/llm/llama-b8599/libmtmd.so.0)
./llama-b8599/llama-cli: /usr/lib/aarch64-linux-gnu/libstdc++.so.6: version `GLIBCXX_3.4.29' not found (required by /home/jetson/llm/llama-b8599/libmtmd.so.0)
./llama-b8599/llama-cli: /lib/aarch64-linux-gnu/libm.so.6: version `GLIBC_2.29' not found (required by /home/jetson/llm/llama-b8599/libllama.so.0)
./llama-b8599/llama-cli: /lib/aarch64-linux-gnu/libc.so.6: version `GLIBC_2.33' not found (required by /home/jetson/llm/llama-b8599/libllama.so.0)
./llama-b8599/llama-cli: /lib/aarch64-linux-gnu/libc.so.6: version `GLIBC_2.32' not found (required by /home/jetson/llm/llama-b8599/libllama.so.0)
./llama-b8599/llama-cli: /lib/aarch64-linux-gnu/libc.so.6: version `GLIBC_2.34' not found (required by /home/jetson/llm/llama-b8599/libllama.so.0)
./llama-b8599/llama-cli: /lib/aarch64-linux-gnu/libc.so.6: version `GLIBC_2.38' not found (required by /home/jetson/llm/llama-b8599/libllama.so.0)
./llama-b8599/llama-cli: /usr/lib/aarch64-linux-gnu/libstdc++.so.6: version `GLIBCXX_3.4.29' not found (required by /home/jetson/llm/llama-b8599/libllama.so.0)
./llama-b8599/llama-cli: /usr/lib/aarch64-linux-gnu/libstdc++.so.6: version `CXXABI_1.3.13' not found (required by /home/jetson/llm/llama-b8599/libllama.so.0)
./llama-b8599/llama-cli: /usr/lib/aarch64-linux-gnu/libstdc++.so.6: version `GLIBCXX_3.4.26' not found (required by /home/jetson/llm/llama-b8599/libggml.so.0)
./llama-b8599/llama-cli: /lib/aarch64-linux-gnu/libc.so.6: version `GLIBC_2.32' not found (required by /home/jetson/llm/llama-b8599/libggml.so.0)
./llama-b8599/llama-cli: /lib/aarch64-linux-gnu/libc.so.6: version `GLIBC_2.34' not found (required by /home/jetson/llm/llama-b8599/libggml.so.0)
./llama-b8599/llama-cli: /usr/lib/aarch64-linux-gnu/libstdc++.so.6: version `GLIBCXX_3.4.29' not found (required by /home/jetson/llm/llama-b8599/libggml-base.so.0)
./llama-b8599/llama-cli: /lib/aarch64-linux-gnu/libc.so.6: version `GLIBC_2.38' not found (required by /home/jetson/llm/llama-b8599/libggml-base.so.0)

[링크 : https://github.com/ggml-org/llama.cpp/releases/tag/b8599]

'프로그램 사용 > ai 프로그램' 카테고리의 다른 글

qwen3.5 0.8B  (0) 2026.07.19
LLM 지식 증류(knowledge distilation), lora  (0) 2026.07.18
sLLM (경량 언어모델)  (0) 2026.07.18
딥러닝은 참.. 전기가 많이 드는구나..  (0) 2026.07.16
claude code /model  (0) 2026.07.08
Posted by 구차니
게임/니어 오토마타2026. 7. 19. 20:50

모든 엔딩은 다 보았고

이름을 남기기 완료

 

 

자 10회차 가자고 ㅋㅋㅋ

Posted by 구차니

테스트 해보니

IQ2_M 은 영어로 하던 한글로 하던 반복해서 쓸수가 없고

Q4 / Q8은 생각하지 않게하니 응답은 한다.

llama-b10068-bin-win-cuda-12.4-x64>llama-cli.exe --chat-template-kwargs "{\"enable_thinking\": false}" -m Qwen3.5-0.8B-UD-IQ2_M.gguf

 

1060 6GB

모델 파일 크기 VRAM tokens per second
Qwen3.5-0.8B-UD-IQ2_M.gguf 354 MB 3897 - 86 MiB ~ 89
Qwen3.5-0.8B-UD-Q4_K_XL.gguf 532 MB 4073 - 86 MiB ~ 86
Qwen3.5-0.8B-UD-Q8_K_XL.gguf 1.10 GB 4313 - 86 MiB ~ 62

 

 

아래 처럼하면 엄청 줄일 순 있는데

llama-b10068-bin-win-cuda-12.4-x64>llama-cli -c 4096  -ctk q4_0  --chat-template-kwargs "{\"enable_thinking\": false}" -m Qwen3.5-0.8B-UD-Q4_K_XL.gguf

 

컨텍스트만 해도 이정도로 줄어든다.

-c 4096 797 MiB

-c 8192 861 MiB

-c 16384 953 MiB

 

Q8은 많이 줄어들진 않는다.

llama-b10068-bin-win-cuda-12.4-x64>llama-cli -c 4096 --chat-template-kwargs "{\"enable_thinking\": false}" -m Qwen3.5-0.8B-UD-Q8_K_XL.gguf

-c 4096 1395 MiB

-c 8192 1447 MiB

-c 16384 1551 MiB

 

그래도 이정도면 2GB 에서도 어떻게 돌릴순 있을듯 한데?

 

+

1187 MiB. 와우

ffprobe와 ffmpeg을 넣어줘도  big bunny 60MB 짜리를 못하네 쩝.. 어떻게 해야 돌릴수 있지?

D:\study\llm\llama-b10068-bin-win-cuda-12.4-x64>llama-cli -c 4096 -ctk q4_0 --chat-template-kwargs "{\"enable_thinking\": false}" -m Qwen3.5-0.8B-UD-Q4_K_XL.gguf -mm mmproj-F16.gguf


Loading model...

▄▄ ▄▄
██ ██
██ ██  ▀▀█▄ ███▄███▄  ▀▀█▄    ▄████ ████▄ ████▄
██ ██ ▄█▀██ ██ ██ ██ ▄█▀██    ██    ██ ██ ██ ██
██ ██ ▀█▄██ ██ ██ ██ ▀█▄██ ██ ▀████ ████▀ ████▀
                                    ██    ██
                                    ▀▀    ▀▀

build      : b10068-571d0d540
model      : Qwen3.5-0.8B-UD-Q4_K_XL.gguf
ftype      : Q4_K - Medium
modalities : text, vision, video

available commands:
  /exit or Ctrl+C     stop or exit
  /regen              regenerate the last response
  /clear              clear the chat history
  /read <file>        add a text file
  /glob <pattern>     add text files using globbing pattern
  /image <file>       add an image file
  /video <file>       add a video file

 

+

2026.07.19

jetson nano에 하려고 했더니

ollama 업데이트 -> glibc 버전 문제로 먹통

llama.cpp -> libssl.so.3 / libcrypto.so.3 문제로 실행불가

빌드 하려니 32GB 짜리인데도 93% 라서 먼가 할수 없는 상황 -_-

'프로그램 사용 > ai 프로그램' 카테고리의 다른 글

llama.cpp for arm64  (0) 2026.07.20
LLM 지식 증류(knowledge distilation), lora  (0) 2026.07.18
sLLM (경량 언어모델)  (0) 2026.07.18
딥러닝은 참.. 전기가 많이 드는구나..  (0) 2026.07.16
claude code /model  (0) 2026.07.08
Posted by 구차니
게임/니어 오토마타2026. 7. 18. 22:55

후.. 또 언제 탄막하고 10회차 가지? ㅋㅋㅋ

 

3식 전술창 얻고 강화하기 전

 

강화하고 나니 빨간점이 하나 생긴다.

 

에밀이 무엇을 결심할걸까

 

 

에일리언들이 지구 와서 겁나 후회했을 것 같은 비주얼 1

에일리언 : 아니 환공포증 아니아니 게슈탈트 붕괴 올뻔했다고 (어?!)

 

에일리언들이 지구 와서 겁나 후회했을 것 같은 비주얼 2

에일리언 : 아니 쟤네 눈에서 레이저가 나온다고!!! C8!!!!

 

이거 놓치면 안된다고 했는데

정작 못 잡아서 한 번 더 봄 ㅋㅋㅋㅋ

 

 

 

 

솔찍히 내가 만나던 에밀이 흑화해서 다 죽이겠다! 하는게 아니라서 다행이야 ㅠㅠ

Posted by 구차니